高精度光学字符识别服务,支持通用印刷体、发票票据、表格结构化、手写体等多场景文字提取,覆盖中英日等 15 种语言,适用于票据录入、文档数字化、车牌识别、证件信息采集等场景。
OCR 文字识别 API 通过标准 HTTP GET 请求接收图片 URL 或 Base64 编码,返回结构化 JSON 数据。支持通用印刷体、发票、表格、手写体四种识别模式,可自动检测图片中的文字区域并逐行输出识别结果,包含置信度与位置坐标。内置图片预处理引擎,自动校正倾斜、去噪增强,确保复杂场景下的高识别率。接口全程 HTTPS 加密传输,支持高并发调用,适用于线上生产环境。
| 参数名 | 类型 | 必填 | 说明 |
|---|---|---|---|
| apikey | string | 是 | 用户身份密钥,在控制台「应用管理」中创建应用后获取。 |
| image_url | string | 是 | 待识别图片的 URL 地址,与 image_base64 二选一。支持 JPG/PNG/BMP/WebP 格式,图片大小不超过 10MB。 |
| image_base64 | string | 否 | 图片的 Base64 编码字符串,与 image_url 二选一。无需包含 data:image 前缀。 |
| type | string | 否 | 识别模式:general(通用印刷体,默认)、invoice(发票票据)、table(表格结构化)、handwriting(手写体)。 |
| lang | string | 否 | 识别语种:auto(自动检测,默认)、zh(中文)、en(英文)、ja(日文)等,完整列表见开发文档。 |
| 字段名 | 类型 | 说明 |
|---|---|---|
| code | int | 状态码,200 表示请求成功,其余见错误码对照表。 |
| msg | string | 状态描述信息。 |
| data.text | string | 识别出的完整文本内容,所有区域文字按阅读顺序拼接。 |
| data.regions | array | 文字区域列表,每个元素包含单个文字区域的详细信息。 |
| data.regions[].text | string | 该区域识别出的文字内容。 |
| data.regions[].confidence | float | 该区域的识别置信度,范围 0~1,越接近 1 准确率越高。 |
| data.regions[].position | array | 文字区域的四角坐标,格式 [[x1,y1],[x2,y2],[x3,y3],[x4,y4]]。 |
| data.language | string | 检测到的主要语种,如 zh、en、ja。 |
| data.word_count | int | 识别出的总字符数。 |
| data.process_time | string | 服务端处理耗时,单位毫秒。 |
| data.update_time | string | 数据更新时间,格式 yyyy-MM-dd HH:mm:ss。 |
{
"code": 200,
"msg": "success",
"data": {
"text": "品名:拿铁咖啡\n数量:1\n单价:28.00\n合计:28.00\n付款方式:微信支付",
"regions": [
{
"text": "品名:拿铁咖啡",
"confidence": 0.993,
"position": [[42, 86], [318, 86], [318, 112], [42, 112]]
},
{
"text": "数量:1",
"confidence": 0.998,
"position": [[42, 120], [186, 120], [186, 146], [42, 146]]
},
{
"text": "合计:28.00",
"confidence": 0.991,
"position": [[42, 154], [246, 154], [246, 180], [42, 180]]
}
],
"language": "zh",
"word_count": 38,
"process_time": "296ms",
"update_time": "2026-07-25 10:15:30"
}
}