跳转到主要内容
本文档接着上一节,说明在获得解析结果后,如何处理解析结果,并在原文件上相应位置画出文本框。
本文档以此示例样本为例。说明如何将文本框绘制于原文件图像上。
运行示例代码前请先安装依赖: pip install PyMuPDF pillow requests

示例代码

在输出目录中,可以看到文本框的渲染效果: visualization

示例代码思路

  • 获取解析结果: 调用获取结果接口并开启 with_document=true,拿到 result.files[].document
  • 提取页面与坐标: 从 document.pages[] 读取 width/height/anglelines[];每个 line.position[x1,y1,x2,y2,x3,y3,x4,y4] 顺时针四点坐标。
  • 准备底图: 使用与解析同一文件生成页面图像。若自行转图,需记录渲染后的 img_width/img_height
  • 坐标缩放: 计算 scale_x = img_width / page.widthscale_y = img_height / page.height,将返回的坐标按比例缩放到底图像素坐标系。
  • 绘制可视化: 逐行将缩放后的四点以折线闭合(或填充多边形)绘制到对应页图像上,可设置线宽、颜色与透明度。
  • 输出与展示: 保存标注后的图片,或在前端画布/SVG/Canvas 中叠加渲染;注意按页一一对应。
  • 可选增强:
    • 处理 angle 旋转:若底图未旋正,需要根据 page.angle 做坐标旋转修正。
    • 多类型着色:不同元素类型可用不同颜色/图例;若有表格、图片等类型,可按需区分。
    • 字符级高亮:若返回 charPositions,对每个字符坐标同样按比例缩放并绘制,获得更精细的回显效果。
    • 性能优化:批量绘制、分辨率权衡、按需分页渲染,避免一次性处理过多页面造成卡顿。
    • 健壮性:空值校验,坐标越界裁剪,容错处理网络/解析异常。
以上流程与具体编程语言无关,其他语言实现时仅需替换:HTTP 请求、JSON 解析、图像绘制与坐标缩放这三个部分的库与API即可。