扫描件检索不准,常见原因出在OCR、版面恢复、切分方式和页码绑定。直接把识别文本扔进向量库,往往会丢失标题层级、表格关系和原文坐标。
本文要点
- 先判断PDF是文本型、图片型还是混合型
- OCR后保留页码、段落和版面坐标
- 表格、脚注、双栏内容不能按普通段落切分
- 检索结果要能回到原页面复核
第一步:把“识别”与“理解”分开
OCR负责把图片转成文字,但识别成功不等于结构正确。公文中的标题、条款、表格、印章和页眉页脚需要分别处理,否则检索时很容易把无关内容拼在一起。
第二步:切分时保留业务语义
固定字数切分虽然简单,却可能把一条完整规定从中间截断。更稳妥的做法是结合标题层级、条款编号、表格行列和自然段边界切分,同时保存前后文关系。
第三步:用原文回看检验召回
测试时不要只看模型给出的答案。应点击引用,确认系统能打开对应PDF页并定位到命中原文。只有“答案—引用—页面—原文”链路完整,业务人员才能放心使用。
结合实际项目落地
冠唐在政务知识库中把OCR、版式解析、页码保留和原文定位放在同一条处理链路中,重点解决扫描公文与复杂PDF的核验问题。
常见问题
OCR准确率高,为什么检索仍然不准?
因为检索还依赖文档结构、切分边界、表格关系和重排策略,单看字符识别率不够。
扫描PDF必须全部人工整理吗?
不必,但关键制度和高频材料应抽样复核解析结果。