工程资料一半不是干净文本:盖章的扫描合同、跨页的清单表格、现场巡检照片。三条解析路径各有错法,核验设计比模型选择更重要。
本课回答的业务问题:扫描版合同、工程量清单表格、现场照片,AI 分别怎么“读”?读出来的数字能信吗?印章和签字能自动鉴别吗?
前置课程:第 2 阶段第 5 课(RAG 下——解析是地基)、第 3 阶段第 1 课(评估)。
读完本课你将能够:
- 为一份具体材料选择正确的解析路径(文本层、OCR、视觉模型),不再“一把梭 OCR”;
- 针对金额、日期、表格行列、缺页四类风险设计核验规则;
- 准确说出“检测”与“鉴定”的边界,避免让系统背它背不动的责任。
一句话定义
多模态文档处理 = 让系统“读”图像型资料,三条路径:文本层直接解析(原生 PDF/Word 里的文字)、OCR(图像转文字)、视觉模型(模型直接看图理解)。图像理解 ≠ 真伪鉴定——能看出“这里有个章”,不能鉴定章是真是假。
三个词常被混用,先分清:你的合同扫描件是“图像”,不是“文本”;系统能不能读对,第一步取决于选对路径——大量“AI 识别不准”的项目,根子是拿 OCR 的思路处理电子件(或反过来),路径就错了,换多贵的模型都救不回来。
生活化类比:资料室的三种人
把三条路径想成资料室里三位工作人员:
| 路径 | 类比 | 擅长 | 错法 |
|---|---|---|---|
| 文本层解析 | 拿到电子版 CAD 图,直接读内嵌数据 | 精确、便宜、零错字 | 扫描件上没有数据层——无米之炊 |
| OCR | 资料员逐字誊抄 | 覆盖面广、技术成熟 | 0 认成 6、漏盖骑缝字、表格错位 |
| 视觉模型 | 有经验的老工程师翻图看照片 | 理解版式、图表、场景 | 细节计数不可靠、“脑补”没看清的字 |
展开说:誊抄员(OCR)勤恳但机械,字迹清晰时近乎零错,遇到印章遮挡、模糊扫描、手写批注就开始出错——而且错得很有条理(“0”和“O”、“1”和“l”,人眼都要看两眼)。老工程师(视觉模型)强在整体理解:一眼看出“这页是签证单、这个位置应该有签字栏、表格有 8 列”,但他数钢筋根数会看花眼,看不清的字可能“按常理”给你补一个——经验和脑补是同一枚硬币的两面。
类比失效处:真人誊抄员遇到看不清的字会标”?“上交,OCR 和视觉模型默认不会——除非你在系统层设计”低置信必须上报、禁止静默纠错“的出口。这个差异是后面所有核验设计的出发点:机器不会不好意思,它要么答错,要么被你逼着承认看不清。
本质与能力边界
1. 路径选择:永远先查文本层
拿到一份材料,第一个动作是判断“它有没有文本层”:
- 原生电子件(Word 导出的 PDF、电子表格):文件里内嵌着精确文本,直接提取——又准又快又免费。用 OCR 去处理它,反而引入识别错误(把精确数据过一遍易错通道),属于花钱买错;
- 扫描件/照片(盖章合同、签证单、证书):没有文本层,必须走 OCR 或视觉模型;
- 混合体(电子版 + 扫描附件页):常见于合同正文加扫描签字页——分别处理再拼接,拼接处要核对页序。
判断方法很朴素:试着选中复制里面的文字——能复制的是文本层,选不中的基本是图。技术上程序可以自动判断,但你要知道这个分类存在,因为供应商报价单里“文档解析费”的差异,常常就藏在按哪条路径算。
2. OCR 的错误地图与对应校验
OCR 不是“错了就错了”,它的错误有规律,规律对应的校验规则可以提前设计:
| 错误类型 | 典型场景 | 业务后果 | 校验规则 |
|---|---|---|---|
| 单字形近 | 0↔O、1↔l、8↔B(金额、编号) | ¥1,240,000 变 ¥1,24O,000 | 数值字段正则校验:非法字符即标异常,禁止静默修复 |
| 数字位错 | 逗号/空格错位、断行(12,400 → 1,240 0) | 清单量错 10 倍 | 与台账/申请单交叉核对;超阈值告警 |
| 漏识 | 印章遮挡、骑缝字、浅色笔 | 关键条款缺字 | 缺字检测 + 人工比对原图 |
| 表格错位 | 合并单元格、跨页表 | 行列对应错乱 | 行列抽查:随机取“某行某列”对照原图 |
核心纪律:金额、日期、比例这类关键字段,永远配程序校验 + 抽样人工比对。OCR 单字准确率 99% 听着很高,但一份签证单 200 个字符里平均就有 2 个可疑点,落到金额上就是事故。不要问“OCR 准不准”,要问“错了能不能被发现”——可发现的错误是成本,不可发现的错误才是风险。
3. 视觉模型:会看,也会“脑补”
视觉模型直接读图,价值在 OCR 覆盖不了的地方:
- 版式理解:识别“这是签证单/证书/巡检照片”,找到“签字栏在第几栏”、“金额在合计行”——给抽取指路;
- 图表理解:横道图、饼图的大致内容描述(精确读数仍不可靠);
- 场景判断:巡检照片“疑似临边防护缺失”(文字描述示例)——初筛分类的利器。
边界同样清晰:
- 细节计数不可靠:“图里有 23 根钢筋”这类任务,模型可能每次数出不同的数——计数交给人工或专门工具;
- “脑补”风险:看不清的小字、模糊的印章文字,模型可能按“常见写法”补出来,且补得理直气壮。防线:提示词要求“看不清就报’无法辨认’”,系统对“无法辨认”有出口(转人工),并对关键字段做“图—文对照”核验(识别结果与原图局部并排显示,人工扫一眼);
- 报告置信度≠可信度:模型说“我 95% 确定”,这个数字本身也是生成的——别把它当统计概率用,当“模型的态度”看。
4. 表格是独立的难题:字对了,格子也可能错
工程量清单、报价表这类材料,识别错误分两层:文字层(某个字认错了)和结构层(字全对,但贴错了行列)。结构层错误更隐蔽,也更有建筑行业特色:
- 合并单元格:“厂房 A / 厂房 B”合并表头,识别结果可能把两栋楼的量记串;
- 跨页续表:清单在第 3 页没列完、第 4 页接着列,续表常常没有表头——程序把第 4 页第一行当表头,后面全部错位;
- 多级表头:“其中:人工费 / 材料费”这种嵌套列,层级关系容易丢失。
好在表格自带一把校验尺——勾稽关系:合计行应等于各行之和,合价应等于清单量 × 单价,续表行数应连续。这些校验不用 AI,纯程序就能跑,而且一抓一个准。所以表格材料的验收指标不能只问“识别准确率”,要问”勾稽校验通过率“:过不了勾稽的行,自动标出转人工。表格最安静的错法,是一个字都没认错、但每一行都贴错了位置——而勾稽校验恰恰专治这种安静的错。
5. 检测 ≠ 鉴定:责任的硬边界
系统能做的叫检测:定位“此处有红色圆形图案(疑似印章)”“此处有手写痕迹(疑似签字)”“签字栏为空”。系统不能做的叫鉴定:这个章是真是假、签字是否本人所签、证书是否伪造。
这条边界直接决定合同条款怎么写:供应商说“自动识别印章真伪”——超出了当前技术能力的可靠承诺;你说“系统盖了章就代表验过真伪”——把系统背不动的责任压给了它。正确分工:系统检测(有没有、在哪里、缺没缺),人和专业程序鉴定(真不真、是不是本人)。缺章检测是真需求(“签署页无任何印章痕迹”的提醒很有价值),真伪鉴定是伪需求(把伪需求写进需求清单,验收时必然翻车)。
6. 核验三件套:多模态上线的标配
无论哪条路径,上线前把三件套配齐:
- 页码完整性:每份材料先过一遍页数与目录核对——缺页检测(“第 5 页缺失”)。缺页比错字更隐蔽也更致命:签证单少一页,后面全错;
- 交叉核对:多来源数值互验——签证金额 vs 申请单金额、清单量 vs 台账量、证书编号 vs 官方查询结果(如可查)。单来源的数字只能靠人工抽查,双来源的可以程序互验;
- 抽样比对:按比例(如 10%)抽取识别结果与原图并排显示,人工快速过——这是发现“系统性错误”(某类字体全识别错)的最后防线。抽样记录留档,作为质量证据。
实战演练:120 份扫描签证单入库的管线搭建与首月质检
场景(虚构):青柏产业园结算期,120 份扫描版工程签证单(QB-XJ-01,盖章、含手写金额)要入库并抽取字段。管线设计与首月运行记录:
管线(五段):
① 预检:页数核对(与台账登记页数比对)→ 3 份缺页,退回补扫
② 双路识别:OCR 全文 + 视觉模型版式定位("金额栏""签字栏"位置)
③ 抽取:单号/日期/金额/事项/签字状态 → 结构化输出
④ 程序校验:单号格式与去重;日期格式;金额正则(拦非法字符);
与申请单金额交叉核对(偏差 >5% 标黄)
⑤ 人工质检:12 份(10%)图文并排比对,记录错误类型
首月质检记录(节选,虚构数字):
| 周 | 发现问题 | 归因 | 处置 |
|---|---|---|---|
| 第 1 周 | 3 份金额栏识别为空(印章盖在金额上) | OCR 漏识 | 视觉模型辅助定位 + 转人工补录 8 处 |
| 第 2 周 | 交叉核对拦下 2 处金额错位(“12,400”断行成“1,240 0”) | 扫描断行 | 该批次退回重新扫描;加“数字后接空格”校验规则 |
| 第 3 周 | 1 份签字栏“有痕迹”但实为污渍 | 视觉模型误判 | 判定标准改为“人工确认签字状态”,模型只标“疑似” |
| 第 4 周 | 抽查 12 份,字段级错误率 0.9%(11/1200 字段) | — | 维持抽检;报告注明口径 |
两个值得记住的数字感觉:①没有交叉核对,第 2 周那 2 处错位金额(合计约 34 万元,虚构)已经进结算;④字段级 0.9% 的错误率听着低,但“金额类字段”的错误率必须单独报——合计类字段错一个就是大事故,不能被总量平均稀释。质检报告永远分层报:总体错误率 + 关键字段错误率 + 高风险字段零容忍清单。
顺手算一笔成本账(数字怎么算):纯人工录入 + 复核,每份签证单约 10 分钟,120 份 ≈ 20 小时;管线模式下,机器处理每份只需几秒(API 费用每份以分计,具体价格以当时文档为准),人工只剩两块——12 份抽检 × 5 分钟 + 约 15 份异常件处理 × 6 分钟 ≈ 2.5 小时。省下的 17 个小时不是重点,重点是人工时间的性质变了:从“誊抄”(随机疲劳出错、错了难发现)变成“核对”(对着系统标出的可疑点逐条确认)。自动化真正的收益不是快,是让错误变得有规律、可拦截、可统计。
建工案例:签证单与巡检照片的两个定位
签证单(结构化抽取):见实战演练——核心是“双路识别 + 交叉核对 + 分层质检”,视觉模型当“指路的”,OCR 当“抄写的”,程序当“对账的”,人当“终审的”。
巡检照片(初筛分类):现场每日照片流(文字描述示例:“临边防护栏杆缺失”“配电箱未上锁”“动火作业无看板”)。设计定位要克制:
- 做的:视觉模型初筛分类(是否疑似隐患、类型、位置描述),生成工单派人工确认;批量归档打标(按区域/类型),方便追溯;
- 不做的:数量统计(计数不可靠)、处罚依据(须经人工确认的记录才能进流程)、隐患等级终判(人定);
- 验收口径:初筛召回率(该发现的发现了多少,宁高勿漏)+ 误报率(人工确认的工作量)——这个场景与签证单相反:宁可多报,不可漏报,因为它漏掉的是安全风险。
同一个“多模态”,签证单要“准”,巡检要“全”——验收指标跟着业务风险走,不跟着技术能力走。
供应商话术拆解
话术:“我们的系统能自动识别印章、签字和表格,扫描材料直接入库。”
逐问拆解:
- “识别”是检测还是鉴定?——让他明确:能定位印章/签字位置(检测),能不能判真伪(鉴定)?后者要求书面排除,否则验收时他拿“检测”冒充“鉴定”,出了事故责任说不清;
- 表格识别的实际水平?——拿你们最复杂的一张清单(合并单元格 + 跨页续表)现场测,看行列对应,并要求报勾稽校验通过率(合计=各行之和,见本课“表格是独立的难题”);“我们支持表格”和“你们的表格能读对”是两回事;
- 金额类字段错误率与校验方案?——分层报:总体错误率 + 金额字段错误率;有没有交叉核对、非法字符拦截?错误率答不出、只说“很成熟”的,没做过分层统计;
- 看不清的内容怎么处理?——合格答案:“有’无法辨认’出口,转人工,不静默纠错”;不合格答案:“我们算法会自动修正”(自动修正 = 静默编造);
- 缺页、倾斜、模糊件?——有没有预检环节,还是硬着头皮出结果?
合格回答应该长什么样:“印章做位置检测,不做真伪鉴定(合同写明);表格用结构化解析,贵方样例实测行列正确率 X%;金额字段单独统计错误率并配正则与交叉核对校验;低置信内容标’待人工’不自动修复;入库前有缺页预检。”——每一条都带边界和数字。
常见问答
Q1:手机拍照直接识别,行不行? 日常查询场景(拍合同问条款)多数够用;入库场景要求更高——拍照的光照、倾斜、反光都会放大识别错误。规则:要入库走流程的,用扫描件;临时看看的,拍照可以。别拿手机的随手拍当结算依据的源头。
Q2:识别结果带“置信度 95%”,能信吗? 先分清是谁报的:OCR 引擎的字符级置信度是根据候选字形差距算出来的,大体可用——适合做阈值过滤(低于阈值自动标黄转人工);生成式模型自报的置信度(“我 95% 确定”)是模型生成的文字,不是统计概率,只能当“模型的态度”看。两者共同的用法:低置信触发人工复核——这是置信度的正确打开方式;共同的禁忌:高置信≠一定对——不能因为置信度高就免检关键字段。金额、日期这类字段,置信度再高也要过程序校验。
Q3:为什么 Excel 导出成 PDF 再识别,反而更容易错? 因为绕了远路:Excel 本来有精确文本层,转成 PDF 若变成图像(或部分图像化),精确数据被降级成“识别数据”。能拿到原始电子文件的,永远用原始文件;PDF 是否保文本层,导出时就选对(别用“打印为图像”方式)。
Q4:视觉模型和 OCR 会互相取代吗? 短期内是分工不是替代:OCR 便宜、快、适合全文转文字;视觉模型贵一些、强在版式和场景理解。成熟管线常常双路并用(OCR 抄字、视觉指路),就像实战演练里那样。
Q5:巡检照片能不能直接出处罚单? 不能。初筛结果必须经人工确认才能进管理流程——这既是技术边界(分类有误报),也是管理合规(处罚要有事实依据)。系统的价值是“别漏”,判罚权留给人。
Q6:我们公司十几年纸质档案,能批量数字化吗? 能,但按价值分级做:先数字化高频调用的(近三年合同、证书),低频档案排后;批量入库前先小批量试跑(100 份),统计错误类型和校验规则命中率,管线稳了再放量。数字化项目的失败模式不是“识别不了”,是“识别错了没人发现”。
Q7:多模态为什么放在第 4 阶段才讲? 因为它站在前面所有课的肩膀上:解析质量影响 RAG(第 2 阶段第 5 课)、抽取要结构化输出(第 2 阶段第 2 课)、上线要评估三件套(第 3 阶段第 1 课)。没有这些基础,多模态就是“演示很炫、上线就翻车”。
Q8:手写金额、手写批注能识别吗? 能识,但手写是所有路径的最弱项——连笔、个人字迹差异大,打印体的准确率不能外推到手写体。签证单上的手写金额,稳妥定位是“机读 + 人核”:系统给出识别结果并与原图局部并排显示,人扫一眼确认后才入库,而不是“机读直连台账”。如果供应商承诺手写识别率,验收时用你们自己的真实手写样本测——别用他的打印体测试集,那是两个物种。
自测
结算扫描件里 OCR 把“1,240,000 元”认成“1,24O,000 元”(字母 O 混入)。这条会怎么影响下游?在哪些环节可以拦住?
参考要点(先自己作答,再展开对照)
下游影响分两种处理方式:①入库时类型校验(金额字段必须纯数字)会拒绝——表现为“入库失败”,需要人工处理,烦但安全;②更危险的是系统做了“静默清洗”(把 O 当 0 处理)——金额显示为 1,240,000,碰巧对了纯属运气,清洗逻辑一旦把“真正的错字”也“修正”了,错误就不可见。结论:宁可入库失败,不要静默修复。
拦截环节(由近及远):①OCR 后处理规则:金额字段正则校验,含非数字字符即标异常、转人工;②结构化输出校验:类型/格式校验拒绝该字段(第 2 阶段第 2 课的第三道闸);③交叉核对:签证金额与申请单金额互验,对不上即告警;④抽样人工比对:图文并排抽查兜底,发现“系统性”错误(某类字体全错)。
答题要点:错误可发现是成本、不可发现是风险;金额字段禁止静默纠错;多层拦截 + 抽样兜底。
概念卡片
| 名词 | 一句话定义 |
|---|---|
| 文本层解析 | 直接读取电子文档内嵌文本——精确免费,永远优先于 OCR |
| OCR | 图像转文字;错误有规律(形近字/错位/漏识),对应校验规则可预制 |
| 视觉模型 | 直接理解图像:强在版式与场景,弱在计数,会“脑补”看不清的内容 |
| 检测 vs 鉴定 | 能定位印章/签字(检测),不能判真伪(鉴定)——责任硬边界 |
| 勾稽校验 | 表格自带的校验尺:合计=各行之和、合价=量×单价,纯程序可跑,专治“字对格错” |
| 核验三件套 | 页码完整性、交叉核对、抽样比对——多模态上线标配 |
| 分层错误率 | 总体错误率与关键字段(金额)错误率分开报,不被平均稀释 |
延伸阅读
- 与第 2 阶段第 5 课(解析是 RAG 地基)、第 3 阶段第 1 课(评估)配合复习。
- 各 OCR/视觉模型的能力与价格属动态信息(2026-09 核验:仍以自家真实样本实测为准,具体能力清单与计价以当时官方文档为准);本课的核验设计方法长期适用。