扫描件检索不准,常见原因出在OCR、版面恢复、切分方式和页码绑定。直接把识别文本扔进向量库,往往会丢失标题层级、表格关系和原文坐标。

本文要点

第一步:把“识别”与“理解”分开

OCR负责把图片转成文字,但识别成功不等于结构正确。公文中的标题、条款、表格、印章和页眉页脚需要分别处理,否则检索时很容易把无关内容拼在一起。

第二步:切分时保留业务语义

固定字数切分虽然简单,却可能把一条完整规定从中间截断。更稳妥的做法是结合标题层级、条款编号、表格行列和自然段边界切分,同时保存前后文关系。

第三步:用原文回看检验召回

测试时不要只看模型给出的答案。应点击引用,确认系统能打开对应PDF页并定位到命中原文。只有“答案—引用—页面—原文”链路完整,业务人员才能放心使用。

结合实际项目落地

冠唐在政务知识库中把OCR、版式解析、页码保留和原文定位放在同一条处理链路中,重点解决扫描公文与复杂PDF的核验问题。

常见问题

OCR准确率高,为什么检索仍然不准?

因为检索还依赖文档结构、切分边界、表格关系和重排策略,单看字符识别率不够。

扫描PDF必须全部人工整理吗?

不必,但关键制度和高频材料应抽样复核解析结果。