AI 课堂

能力边界与幻觉的根源

2026-08-02修订于 2026-09-17

本课结构 点击折叠
  1. 一句话定义
  2. 生活化类比(建筑行业版)
  3. 本质与能力边界
  4. 实战演练:一次幻觉事故的完整排查
  5. 建工案例:一次“幻觉”的三种病因
  6. 向领导解释(示例话术)
  7. 供应商话术拆解
  8. 常见问答
  9. 自测
  10. 概念卡片
  11. 延伸阅读

幻觉不是偶发故障,而是概率生成的伴生特性。更重要的是:出错的未必是模型——资料、检索、工具、程序各有各的错法,处理方式完全不同。

本课回答的业务问题:模型为什么会编造条款号、用错制度版本?出错时先查什么?“AI 初审、人做终审”的分工依据是什么?

前置课程:第 1–4 课(本阶段收尾课)。

读完本课你将能够

  1. 说清幻觉的机制——“流利、格式规范”恰是掩护而非质量证明;
  2. 出错时按“证据→资料→检索→工具→模型”链路归因排查,别先改提示词;
  3. 用可回查引用、允许未提及、程序核数,把幻觉从“事后吵架”变成“流程可控”;
  4. 拆解“准确率 98%、免人工复核”类宣传,说出验收该要的口径。

一句话定义

幻觉是模型生成看似可信、但与事实或所给证据不符的内容。生成流利不保证真实;而且具体失败可能来自资料、检索、工具或程序——必须先诊断,再谈处理

“看似可信”——编造的内容语言上完全合格:条款号规范、术语地道、语气笃定。“第 12.3 条”能骗过初核,恰因它太像真条款——错的和对的在语言质量上没有区别,这才最危险。

“与事实或所给证据不符”——两把尺子:对外,制度改版了模型还按旧版说,错在参数过期;对内,材料在输入里却漏看附件、读错金额,错在证据使用。修法不同:前者靠资料与版本控制,后者靠流程与解析质量。

“生成流利不保证真实”——生成按 token 概率续写(见第 1 阶段第 1 课),流利与正确是两个维度:训练让模型“说得像”,没保证“说得对”;推理计算同样买不到事实(见第 1 阶段第 4 课)。

“先诊断,再谈处理”——同一条错误输出,病因可能在模型或资料、检索、工具、程序,药完全不同。幻觉是症状,不是诊断——本课主线。

生活化类比(建筑行业版)

模型像一位能快速理解案卷并起草意见的助手:博览群书但可能记错细节、漏读附件、误解材料。给他原件、检索工具和检查表能改善表现,但他的自信和长解释都不能替代核验——正如实习工程师的施工方案再厚,也要总工签字。

类比成立在哪:第一,“给原件、给工具、给检查表”对应工程手段——上下文备材料(见第 2 阶段第 3 课)、接检索与计算工具(见第 2 阶段第 6 课)、检查表约束输出——幻觉率是可管理的工程指标;第二,“自信和长解释不能替代核验”对应签字制度——文书再漂亮,也要有人签字背书。

类比失效在哪:第一,人犯错有心理轨迹——疲劳、记混、先入为主,提醒和双检都对症;模型的错法是统计性的,这次对下次错都可能,“你仔细点”收效有限;第二,助手随经验进步,裸模型不随使用变好(见第 1 阶段第 3 课);第三,模型是否承认不确定取决于训练与提问——“允许未提及”要显式写进任务要求。

本质与能力边界

1. 幻觉从哪来:五个来源,五种错法

幻觉从哪来(风险来源 → 表现 → 处理):

风险来源 在合同任务中的表现 可验证的处理
训练目标不等于逐项事实校验 编出格式合理的条款号 原文检索、逐项引用验证、允许“未提及”
参数知识过期 引用旧版制度、错误细节 指定资料版本,检查发布日期与适用条件
上下文、检索或解析失败 漏附件、OCR 把金额读错 分别检查解析、召回、证据、生成环节
奖励与交互诱导 顺着提问附和、证据不足仍作答 测试诱导问法、缺失材料和相反证据
工具/系统故障 计算器对但输入错;写入超时却报“完成” 校验工具参数、返回值和实际状态

这张表是排查索引,逐行讲透。

第一行:训练目标不等于逐项事实校验。预训练教的是“像”:像合同语言、像条款结构(见第 1 阶段第 3 课)。“像一条条款”和“是这条条款”在生成上没有鸿沟——没有依据时,续写一个格式正确的条款号是最“顺”的路径,这就是“伴生特性”。处理:把“编”改成“查”——逐项给原文引用并程序验证(条款号找得到、页码对得上),明确允许“未提及”。

第二行:参数知识过期,或者根本不在参数里。参数里的知识定格在训练完成时,之后发布的制度不会自动进参数;参数像有损压缩,留“印象”不留原文。两种错法要分清:公开规范改版,它可能流畅答出旧版本——这是过期;而公司内部的《分包管理办法》它从头到尾没学过,只能按“常见制度”的样子现编——这是空缺,比过期更危险,因为连旧印象都没有,编起来毫无顾忌。处理相同:指定资料版本,引用带版本与生效日期——动态事实和内部事实都靠检索喂给模型(见第 1 阶段第 3 课)。

第三行:上下文、检索或解析失败。材料在系统里,却没到模型眼前:附件没随文提供、检索没召回、OCR 认错金额——模型只能靠参数猜。排查分四环节:解析(变文本对不对)、召回(该到的到没到)、证据(依据是不是给它的)、生成(结论与依据对不对得上)——见实战演练。

第四行:奖励与交互诱导。后训练让模型乐于满足提问者,副作用是讨好倾向:你问“这条是不是无效”,它可能顺着你点头;材料里没有答案,它硬答而不说“没有”。处理在测试端:故意用诱导问法、缺失材料、相反证据测——看它坚持证据还是顺从提问。

第五行:工具/系统故障。带工具的系统里,错可能在模型之外:计算工具没错但传入参数错了;台账写入超时失败,系统却报“已完成”。这类错最隐蔽——问题在系统边界。处理:调用前核对参数,调用后核对返回值与实际状态——写入查真实回执,不查模型的话。

2. 两个方向性提醒:既不矮化,也不神化

一个方向:不能由“注意力只是加权平均”“生成只是概率续写”断言模型毫无推理能力——经后训练、配工具的模型可以检索、计算、拒答、承认不确定;把机制矮化成能力判决是推理错误。反过来,也不能因对答如流免掉核验:可靠与否是测量出来的,不是推出来的(见第 3 阶段第 1 课)。

3. 裸模型与工具系统:能力装在系统里,责任也一样

裸模型 ≠ 带工具的系统——展开是一张分工表:

业务需求 只靠裸模型 工具系统靠什么 出错先查什么
查最新制度 参数可能过期 带版本标记的检索 召回了什么、哪个版本
算付款比例 概率续写,易错 程序计算 传入参数对不对
读扫描件 读不了或读错 OCR / 视觉解析 解析文本对照原图
登记台账 只会说“已完成” 写入接口 + 回执 实际状态,非模型报告

:最新制度、最新价格不在参数里,在资料库里。版本标记与生效日期是检索的命门:缺了它,旧版可能按字面匹配排到前面(实战演练正是这种)。

:付款比例、金额合计、天数,程序零误差,模型概率性出错——架构上模型列式、程序出数、模型复述。出错先查传给程序的参数:“计算器没错、输入错了”是最常见的假幻觉。

:扫描件先要变成文本。OCR 把“0.03%“认成”0.05%“,引用再忠实结论也是错的——错在解析层;金额、日期、编号要人工校对或双重解析(见第 4 阶段第 1 课)。

:模型说“已登记”不等于台账真有这条。写入可能超时、失败、重复,要查真实回执(库中记录、接口状态),不是模型的自我报告。

最后一句:能力装在系统里,责任也一样——评审“AI 系统”审的是系统整体,不是只审模型。

4. 哪些内容最容易出幻觉:复核要分优先级

幻觉不是均匀分布的。同样一份合同审查输出,不同内容的风险能差一个数量级——复核不该平均用力

高危区:具体编号与数字。条款号、金额、比例、日期、规范编号、证书编号——低频、精确、错一个字符就全错,而生成恰恰擅长“补一个格式正确的”。模型写“第 12.3 条”和写“第 12.2 条”的流利程度完全一样,因为它生成的是“条款号的样子”,不是查到的条款号。凡引用到具体编号,一律回查原文,没有例外。

中危区:转述与归纳。“合同约定了逾期付款违约金”这类转述与原文大面积重合,错法主要是漏条件、偷换限定词——“按月计量”说成“按季度”,“经监理确认后”被悄悄丢掉。抽查就盯三类限定词:时间、主体、前提条件。

相对低危区:框架与清单。“这份合同包含哪些条款类型”这类结构性概括,错法一般是遗漏而非编造——但要防“看着全”:漏掉的那条往往正是冷门的争议解决条款。

实操口诀:编号必核、限定词抽查、框架防漏项。复核人力按这个优先级排,比“从头到尾再看一遍”省时且更有效——人的注意力和模型一样会疲劳,要用在刀刃上。一句话记住:模型负责“像”,流程负责“是”。

实战演练:一次幻觉事故的完整排查

场景(虚构):质量验收工具输出“依据现行《质量验收规范(虚构示例版)》第 5.2.4 条……”。抽查发现该表述来自 2015 修订版,现行版已修改(贯穿案例 QB-GF-01 的“两版对照”场景)。按六步走:

第一步:固定现场。保存输入、输出、引用和日志;不在原会话追问,避免覆盖。

第二步:列三个假设。假设一(资料层):两版都入库但没做版本标记,检索把 2015 修订版排在前;假设二(模型层):检索没命中,模型凭参数旧知识作答;假设三(生成层):召回了现行版,模型抄错条号。

第三步:逐个验证,先易后难。假设三最快——召回文本与输出条号一对:“第 5.2.4 条”就在其中,一字不差,排除抄错。假设一——查检索记录:前两条是 2015 修订版条文,现行版排第四,成立。假设二——关闭检索直接问,它也答出旧表述:参数确有旧知识,但本次走的是检索,主因是假设一。

第四步:归因。主因:知识库缺版本元数据,过滤失效;次因:参数过期,模型对旧表述“读着顺”,没起版本疑心。归因要写下来——写不下来等于没查。

第五步:修复。补版本号与生效日期元数据;检索按“现行版”过滤或加权(见第 2 阶段第 5 课);引用强制带版本号;无法确认时允许答“版本未确认,请人工核对”——修复全在系统层,没有一条是“改提示词让模型仔细点”。

第六步:复测。构造 20 条两版冲突的测试问题(虚构示例)回归跑三轮,全部命中现行版且引用可回查才算修复;上线后保留每周抽查。没有复测的修复,只是把故障改成下次的惊喜。

六步背成一句话:先固定现场,再分层假设;先验证、后归因;修复落在系统层,复测通过才算完。

建工案例:一次“幻觉”的三种病因

青柏项目(虚构)合同审查工具输出:“依据第 12.3 条,逾期付款违约金为每日 0.05%。“人工核对:合同里没有 12.3 条,违约金实际在第 12.2 条(虚构示例),比例为每日 0.03%(贯穿案例口径)。部门第一反应是”模型又编东西了”——先别急,按三个方向排查:

  1. 假设一:模型编造——输入里没有该条款,模型按“常见合同”补全。验证:点开原文引用,指向知识库中该合同的解析文本第 41 页(虚构),赫然写着“第 12.3 条……每日 0.05%”——模型引用的是它看到的,至少不全是编造;
  2. 假设二:检索失败——RAG 没召回真实条款,模型拿到别的项目文本。验证:同一问题在检索环节单跑,召回的正是这段,排除;
  3. 假设三:解析错误——OCR 把 0.03% 认成 0.05%。验证:调出扫描件原图对照——“12.2”的“2”被折痕压变形认成“3”,“0.03%“的”3”被红章盖住认成“5”——解析层出错,错文本喂给了模型。

修复分三层:重新高精度解析、金额人工校对;扫描件金额、比例、日期字段标“OCR 待核”,确认前不得进入结论;同类扫描件复查,又查出两处错误(虚构示例)。

复盘:按“模型编造”处理——改提示词加一句“请仔细核对条款号”——一分钱效果也不会有,因为错不在模型。同一种症状、三种病因、三种药:编造,强制引用原文并允许“未提及”;检索失败,修分块与召回(见第 2 阶段第 5 课);解析错误,换解析方案、加金额校对(见第 4 阶段第 1 课)。没有错误归因的“调优”是碰运气。

向领导解释(示例话术)

“AI 能快速整理合同、找出疑点,但仍可能漏附件、记错条款或用错制度版本。我们让它输出可回查的原文证据,重大结论由法务复核;是否提效,同时看漏检率、复核时间和实际成本。”

构造值得学:先说价值,再交代风险,接着给控制手段,最后把验收落到三个数上——每个判断有对应动作。

供应商话术拆解

话术:“我们的模型准确率 98%,可以免人工复核。”

逐问拆解:

  1. 98% 是什么任务的什么口径?——抽取准确、风险召回、端到端正确,三个数可差很远;样本谁标的、多少条?标注者懂不懂合同决定含金量;
  2. 漏检的 2% 集中在哪?——平均数会骗人:漏检若全集中在违约金、争议解决这类高风险条款,98% 毫无安慰作用——这类条款单独要召回数;
  3. 误报率多少?——免复核的另一面是误报:报一堆假风险,法务逐条排除比初审还累——误报太多同样拖垮效率,两个数一起要;
  4. 免责条款为什么又写“结果仅供参考”?——宣传说免复核,合同说仅供参考,必有一句不真;问清边界在哪。

合格回答应该长什么样:能给出指标定义(什么算一次正确、谁判定)、样本构成、分类型的召回/误报数据;敢谈失败案例——哪类条款最常出错、怎么兜底;对“免复核”给出适用范围而非全称判断;免责条款与宣传一致。只给总数、拒绝谈漏检分布、演示只放成功案例的,不合格。

常见问答

Q1:让模型“再仔细检查一遍”能消除幻觉吗? 不能保证:“仔细检查”也是生成,可能把对的改错、把错的编圆。可靠的做法在流程——证据引用、程序校验、人工抽查,比“认真点”有用。

Q2:提示词里写“不要编造”有用吗? 有帮助但不充分:能压低“未提及却硬答”类错误,改不了上游病因——检索没召回、OCR 读错、参数旧版本。防线要分层(见第 3 阶段第 3 课)。

Q3:怎么快速判断一条输出可不可信? 看证据:关键结论有没有原文引用、能不能回查、数字能否定位到原文;没有引用的一律当“待核”——不信的不是模型,是没有证据的结论。

Q4:幻觉率能降到零吗? 工程手段(版本过滤、引用验证、程序核数、人工复核)能把风险压到业务可接受,但“零幻觉”不可信——伴生特性没有开关。重要交付保留人审,不是保守,是分工。

Q5:让模型回答“不知道”,它会不会什么都答不知道? 有这个副作用:该答不答的过度拒答是后训练可能的回归(见第 1 阶段第 3 课)。两个数一起测——该拒答时的拒答率、不该拒答时的误拒率,只优化一头会翻车。

Q6:换更大、更新的模型能根治幻觉吗? 有帮助,治不了根。更强的模型通常事实记忆更牢、更会说“不知道”,但三条边界不变:参数知识仍有截止日期;内部制度、项目合同它从未见过,只能靠喂材料;检索、解析、工具层的错与模型大小无关——本课建工案例的三种病因,换多大的模型都只对“模型编造”那一种有效。把预算全押在“换模型”上,系统层的洞一个也堵不上。

Q7:同一个问题问两遍,答案为什么可能不一样? 因为生成是概率采样(见第 1 阶段第 1 课):每次续写都在若干候选里按概率挑一个,采样参数决定挑得多“野”(参数名称与默认值以当时文档为准)。两个推论:一,“它上次答对了”不构成这次的保证——验收要看一批题跑多轮的稳定率,不看单次演示;二,需要可复现的交付(如台账字段)应走结构化输出加程序校验(见第 2 阶段第 2 课),把随机性关在门外。

自测

领导问:“能不能让 AI 直接出审查意见,不用法务复核?“用 150 字说明具体会怎样出错,以及系统和人分别负责什么。

参考要点(先自己作答,再展开对照)

会出五类错:编造条款号、漏看附件、用旧版制度、检索或 OCR 读错材料、被诱导附和——而且越流利越有说服力,流利与正确无关。分工:系统初审——抽取条款、定位原文证据、跑规则核对、初筛风险,结论带可回查引用;人终审——重大结论判断、例外裁量、对外交付签字。依据是成本不对称:漏掉一条高风险条款的代价,远大于复核的人力成本。是否提效看漏检率、复核时间、实际成本三个数,不看演示效果。

概念卡片

名词 一句话定义
幻觉 生成与事实或证据不符的内容;具体失败需排查模型/资料/检索/工具
概率续写 常见生成按 token 概率展开,流利不保证真实
有损压缩 理解参数知识局限的类比:参数不是保证精确回查的文档库
讨好倾向 模型可能迎合提问而附和错误观点,程度受训练与交互影响
裸模型 vs 工具系统 查、算、读、写分别靠检索/程序/OCR/回执,能力与责任都在系统层
复核优先级 幻觉分布不均:编号必核、限定词抽查、框架防漏项
采样随机性 同一输入输出可能不同;验收看一批题多轮稳定率,不看单次演示

延伸阅读

← 课程目录