Skip to main content
TextIn 智能文档抽取 API 整合了专业文档解析底座与大模型语义理解能力,支持 Prompt 自由抽取自定义字段精确抽取 两种模式,覆盖 20 余种文件格式,0 样本开箱即用。

01 接口说明

两种抽取模式对比:
当同时传入 promptfields 时,以 Prompt 模式 优先。

02 先决条件

登录 TextIn 控制台,在「账号与开发者信息」中获取:
  • x-ti-app-id
  • x-ti-secret-code

03 完整示例代码下载

完整可运行代码(含 Python、Java 两个版本)已内置在文档仓库的 examples/ 目录下:

Python 示例

查看 Python 完整示例代码

Java 示例

查看 Java 完整示例代码

04 运行示例

环境要求:Python 3.8+1. 安装依赖
2. 填写配置打开 entity_extraction.py,填写文件顶部的配置项:
3. 运行

05 代码说明

初始化:配置鉴权与工具函数

所有请求都需要在 HTTP 头中携带 x-ti-app-idx-ti-secret-code;待抽取文件以 base64 字符串形式放入请求体。

Prompt 模式抽取

传入一段自然语言 prompt,系统将根据 prompt 的描述从文档中提取信息,返回键值对(llm_json)和带坐标的结果(raw_json)。

字段模式抽取(含表格)

提供 fields(单值字段)和 table_fields(表格字段)列表,系统按字段名精确抽取,结果在 details 中按字段名组织。

06 入参说明

请求头

URL 参数

URL 参数以 ?参数名=参数值 形式拼接在请求 URL 后,例如 ?parse_mode=scan&page_count=10

请求体字段

07 出参说明

通用字段

Prompt 模式返回字段(result 对象)

字段模式返回字段(result 对象)

detail_structure 中还包含印章识别结果(stamps),可获取印章颜色、形状、类型和文字内容。

返回示例

08 错误码说明