改提示词、加检索、写规则、微调——四个改动层次,成本和风险逐级上升。先定位问题在哪一层,再决定改哪一层;跳级微调是最贵的弯路。
本课回答的业务问题:提示词怎么调都不稳,是不是该微调了?“行业模型”和自己微调一回事吗?决策怎么做、给谁批?
前置课程:第 1 阶段第 3 课(预训练与后训练)、第 2 阶段第 4–5 课(RAG)。
读完本课你将能够:
- 用“四层改进”框架给任何系统问题定位层次(提示词/检索/规则/微调);
- 判断一个具体问题是“说清就行”“材料不对”“规则缺失”还是“真要训练”;
- 写出一份能给管理层决策用的微调决策备忘录。
一句话定义
改进 AI 系统有四个层次,按成本从低到高:改提示词(改指令)→ 改检索/资料(改输入材料)→ 加规则(加确定性程序)→ 微调(改模型权重)。每一层解决的问题不同:定位错误根源,在最低够用的层次动手。
这四层的关系像处理质量问题的阶梯——每一层都比上一层贵、慢、难回退:提示词改动当天见效、随时可退;检索调整要重灌库、重跑评估;规则开发要写程序、要测试;微调要数据、算力、周期,做完还要全量回归验收(防止旧能力退化)。跳级动手的代价不只是多花钱——是问题没解决还引入了新风险:给“材料没给对”的问题上微调,等于给没吃过饭的人换胃。
生活化类比:工程质量问题的处理阶梯
| 层次 | 类比 | 解决什么 | 见效与代价 |
|---|---|---|---|
| 改提示词 | 完善技术交底 | 员工没听懂要求——说清楚就行 | 当天见效,零沉淀成本 |
| 改检索/资料 | 更换合格材料供应商 | 干不好是因为材料不对——材料对了自然好 | 数天(重整库+重测) |
| 加规则 | 增加硬性工艺卡和复检工序 | 某些环节不能靠手感——必须机械化保证 | 一两周(开发+验证) |
| 微调 | 送员工脱产培训取证 | 系统性的技能/风格缺口——练进肌肉记忆 | 数周至数月(数据+训练+回归验收) |
“交底没写清楚就去送培,是最贵的弯路”——培训费花了、员工回来了,结果发现问题出在交底上,培训白训。反过来,员工真有系统性技能缺口(比如不会看装配式深化图),你一直靠交底加细、师傅盯着,效率也上不去——这时候培训才是对的。对应到 AI:90% 的“要不要微调”之问,答案是先把前三层做完做好。
类比失效处:员工培训完技能是“他的”,跳槽带得走;微调产物(权重)是公司的资产,锁定在你手里——这是微调相对培训的优势。但另一面:员工的知识会随制度更新自然刷新(看了新办法就会用),微调模型不会——制度改版,微调过的模型不会自己知道,要么靠检索供新料,要么重新训练。所以“动态知识靠检索、稳定习惯靠微调”这个分工,不是技术偏好,是两种知识生命周期决定的。
本质与能力边界
1. 第一层:改提示词——先问“说清楚了吗”
适合的问题:任务表述模糊、输出口径不稳、格式不符合要求。这是第 2 阶段第 1 课的全部内容,这里只强调运营纪律:每次修改记版本、用同批样本复测——否则“感觉变好了”无法和“真的变好了”区分,提示词会越改越乱(十个版本的补丁叠在一起,谁也说不清哪条在起作用)。
提示词层的失败信号:改了三五轮、每次修一头冒一头——这时不要再堆补丁,进入下一层的判断。
怎么确认提示词层已经尽力?三条自检:①把提示词拿给一个不懂项目的聪明同事看,他能照做着把任务做对——说明指令本身清楚,错不在表达;②同一批失败样本在新提示词下重跑,错误率明显下降——说明改动有效;③剩下的错误每条都能说出“它还缺什么”(缺材料/缺规则/缺口径)——这些“缺的东西”就是下一层的工单。
2. 第二层:改检索/资料——“不知道”的问题在这层解决
适合的问题:模型不知道公司制度(答通用答案)、用旧版规范(版本污染)、引用断链(找不到依据)。机制:模型的知识分两块——参数里的“底子”和你本次给它的“材料”。凡是“本次该知道的信息”,正确供法是检索和上下文(第 2 阶段第 3、5 课),不是训练。
为什么动态知识不能靠训练?两个硬伤:一是不可溯源——训练进权重的知识,模型“回忆”出来时不带出处、不保证逐字,合同条款和规范条文恰恰要求逐字准确、可指回原文;二是不可撤回——检索库删一份废止文件立刻生效,权重里“忘掉”一份旧文件只能重训。检索给的是摆在桌面上的原件,训练给的是员工脑子里的印象——引用依据这种事,你只能信原件。
一个判断口诀:这个信息多久变一次?每年都变的制度、规范、价格——检索;三五年不变的公司行文风格、审查口径、专业语感——微调候选。变化频率决定知识放哪:检索是“活页夹”(随时换页),微调是“装订本”(改版要重印)。
3. 第三层:加规则——能 if-else 的,不交给模型
适合的问题:确定性判断——金额加总、日期推算、硬性否决项(“无资质即否决”)、阈值告警(“预付款比例 >30% 标红”)。这些任务对就是对、错就是错,模型的概率性在这里毫无价值,只有风险。
规则层是建工业务最被低估的一层:评标否决项、计量公式、审批权限矩阵——这些本来就是成文的确定性规则,用程序实现零误差、可审计、可解释。模型的位置是给规则“喂料”和“解释结果”(抽取字段给规则用、把规则命中的结果写成意见),不是替规则做判断。
一个具体例子(虚构示例):青柏项目合同约定预付款为签约后付合同价 20%,规则层写死“预付款比例 >20% 标红”。后来一份补充协议约定 30%——系统照章标红,人工裁决“补充协议有效、更新规则阈值”。注意这个分工:模型负责把“30%“从扫描件里抽出来,规则负责比对,冲突本身交给人裁决——规则遇到例外不是失灵,是把例外精确地送到人面前。
一个实用检查:把系统输出错的地方列出来,问“这条错误的正确答案,能不能用一句业务规则描述?“能——加规则;不能(需要专业裁量)——才留在模型层。
4. 第四层:微调——三个正当场景与三个不适用
正当场景(有明确验收的):
- 风格与口径固化:公司审查意见的行文风格、分类口径(什么是“背靠背条款”按公司口径算),几千条高质量样本训练后输出稳定性显著提升——验收标准:风格一致率、口径符合率,且其他任务回归不降;
- 小模型替代大模型降本:用大模型的优质输出当教材,训练出的小模型(蒸馏),在限定任务上达到接近质量、成本低数倍——验收标准:同题对照质量 + 单任务成本;
- 领域语感提升:专业术语理解、行业表达习惯——效果有但不神秘,同样要样本验收。
不适用场景(常见错误):
- 动态知识:把现行规范“训进去”——规范一改版全部重训,且模型回答时无法区分“我记得的版本”是不是现行版。制度规范走检索,永远;
- 数据不足时的“增强”:只有两三百条样本,指望微调“学会”一个新能力——样本量不够时微调往往学了表面模式,泛化差还牺牲原有能力(数据量门槛因任务而异,以实测为准,但“几百条就想教会新技能”通常不成立);
- 用微调修检索问题:答错是因为没捞到正确条文、或捞到了没排进上下文(第 2 阶段第 5 课的“没捞到”与“捞到没用上”),微调不修检索管线——病在管道,药别下在胃里。
微调的两个必检风险:①灾难性遗忘——训练新能力导致旧能力退化(合同抽取变好了,通用问答变傻了)——全量回归测试是解药;②数据合规——训练数据(尤其含客户信息的)的来源授权必须书面清晰(第 3 阶段第 3 课)。
还有一个容易低估的成本真相:微调项目里,训练费往往只占小头,数据准备才是大头——收集、清洗、脱敏、标注、授权确认,通常占去大半周期和人力。供应商报价只报“训练费”时,问一句“数据谁准备、准备到什么程度”,预算才完整。一句话记住:微调买得起,数据未必攒得起;攒得起数据的项目,才有资格谈微调。
5. 决策三问与备忘录模板
决策三问(写给管理层):
- 错误的根源在哪一层?——用第 3 阶段第 1 课的失败分析定位:没说清(提示词)/ 没材料(检索)/ 没规则(规则)/ 真不会(微调候选);
- 最低够用的层次是哪层?——从第一层往上试,多数问题死在“没有系统试过前三层”;
- 微调的话:数据、验收、回退三件事准备好了吗?——数据(量、质量、授权)、验收(目标指标 + 回归基线)、回退(不达标能退回原模型)。
微调决策备忘录模板(一页):
【问题】现象 + 频率 + 现有损失(数字)
【归因】失败样本分析:X% 属于___层问题(附样本清单)
【已尝试】提示词 v1-v3 结果 / 检索整改结果 / 规则覆盖情况
【微调方案】正当场景匹配(风格固化/降本/语感);数据来源与量;
训练方式(全参/LoRA 等以技术方建议+实测为准);周期与费用
【验收标准】目标指标(如风格一致率≥95%)+ 回归基线(其他任务不降)
【风险与回退】灾难性遗忘检测方案;不达标退回原模型的路径
【请批】预算、数据授权、责任人
6. 先应用再训练:数据积累的正确顺序
正确的顺序是:先跑应用(提示词+检索+规则)→ 失败样本和人工修正持续积累 → 数据够了、瓶颈明确在模型层 → 再微调。这个顺序的好处:应用阶段就已经产生业务价值(不等训练);积累的失败样本和人工修正记录,恰好是微调最好的训练数据(真实任务、真实纠正);万一微调不划算,你还有一套能用的系统。
颠倒顺序(先训模型再找应用)的结局通常是:训练目标对不上真实任务分布,效果验收不了,钱和数据都沉没。
实战演练:三类失败的归因与处理
场景(虚构):青柏项目合同审查工具运行一个月,复盘错误清单,三类失败:
失败 A:意见书行文风格不统一。五位法务的修订习惯不同,工具五种腔调;提示词里写了“按公司风格”,“公司风格”没有定义,改三轮没用。
先算这笔账值多少钱(数字为虚构示例):项目月产意见书约 400 份,风格符合率 58%,即约 168 份需法务改写;单份改写约 0.5 小时,月返工约 84 小时 ≈ 10 个工日——相当于一名法务近半个月的工作量耗在“统一腔调”上。有了这个数字,后面备忘录里的预算才有对照物。
归因:风格是隐性知识,提示词描述不出来;但它稳定、不常变——微调的正当场景(风格固化)。 处理:收集 800 条人工修订后的成稿(数据授权走流程),LoRA 微调;验收:风格一致率(法务盲评)≥95%,通用能力回归不降;不达标退回原模型。前三层不用再折腾——这不是“没说清”,是“说不清”。
失败 B:引用了 2019 版《分包管理办法》(现行是 2025 版)。 归因:检索层版本污染——新旧版本都进了召回池(第 2 阶段第 5 课踩过的坑)。 处理:检索层默认过滤“已废止”版本、回答强制标注版本号。微调在这里毫无用处——就算把 2025 版训进权重,2019 版还在库里被检索到,照样串;何况下次改版又要重训。
失败 C:付款节点比例加总常见 105%(应该 100% 或注明理由)。 归因:加总是纯计算——模型“心算”概率性出错。 处理:程序规则一行代码:抽取完字段后程序加总校验,≠100% 即标异常退回。永远不要让模型做计算(第 1 阶段第 5 课)。
三类失败三种药,如果当时拍脑袋“上微调解决一切”,A 或许碰巧好点,B、C 原样复发,还要搭上回归验收的成本。这就是“先定位再动手”的价值。
建工案例:一份微调决策备忘录(虚构示例)
【问题】意见书风格不统一(失败 A,见实战演练):6 月抽检 60 份,风格符合率 58%;按月产 400 份、单份改写 0.5 小时测算,法务返工约 10 个工日/月。 【归因】42% 的返工源于风格问题;失败样本分析:风格属隐性知识,提示词三轮无效。 【已尝试】提示词 v1–v3(一致率 58%→63%→61%,无显著改善);检索/规则与本案无关。 【微调方案】正当场景:风格固化。数据:800 条人工修订成稿(含授权确认);方式:LoRA(以技术方实测建议为准);周期 6 周数据 + 2 周训练验收;费用 ¥X(供应商报价)。 【验收标准】风格一致率 ≥95%(法务盲评 100 份);抽取质量回归:52/60 基线不降;通用问答抽测 30 题不降。 【风险与回退】灾难性遗忘检测:全量回归集(见验收标准);不达标即回退 v3 版本(当前生产版),损失仅训练费。 【请批】预算 ¥X;法务部出数据授权与盲评人力 2 人日;责任人:合约部+数字化组。
这份备忘录值得注意的细节:它同时报告了“做什么”和“不做什么”(B、C 两类问题明确排除在微调外);验收标准里回归基线写了具体数字(52/60);回退路径写清了损失上限(训练费)。管理层批的是一份“输了也知道输多少”的方案——这是微调决策该有的样子。
供应商话术拆解
话术:“通用模型不懂建筑,必须用我们微调过的行业模型。”
逐问拆解:
- 先跑基线:通用模型 + 贵方提示词/检索,与“行业模型”在我方任务上同题对照——提升多少、样本在哪?没有基线对照的“行业优化”无从谈起;
- 微调数据:规模、来源、授权链?客户数据会不会进你们的模型(写进合同)?
- 知识更新机制:规范改版怎么跟进?微调不可能月月重训——必须有检索侧设计。答“重新训练”的,问他一次多少钱、多久;
- 灾难性遗忘:行业训练后通用能力退化多少?回归测试数据有吗;
- 退出:微调产物(权重或适配层)归属谁?换底座时能不能带走?
合格回答应该长什么样:“与通用基线的对照数据在附录(我方样本 + 贵方可自备样本盲测);微调数据 12 万条标注条款、授权链清晰,客户数据不进训练(合同第 X 条);规范更新走检索热更新(当周生效),微调季度迭代;通用能力回归测试显示 X 项任务平均变化在 N% 内;LoRA 产物交付归客户(合同第 Y 条)。”
常见问答
Q1:微调一次要多少钱、多久? 取决于模型规模、数据量、训练方式,差异极大——让技术方按你的任务报价,别信“行情价”。你要守住的不是价格,是付款结构跟验收挂钩:目标指标 + 回归基线不达标不付全款。
Q2:我们公司没有标注数据,怎么开始积累? 从应用里长出来:系统跑起来后,人工每次修正就是一条天然标注(修改前+修改后);定期导出整理、注明授权。一年应用积累的修正记录,比专门立项标注一个月的质量更好——因为是真实任务、真实纠正。
Q3:LoRA 和全参数微调怎么选? 技术上:全参数效果好上限高但贵、要的算力大;LoRA 等参数高效方法只训练少量附加参数,便宜、快、易回退(拔掉适配层就回原模型)。管理上你只需要知道:让技术方给两种方案的“成本-效果-回退便利”对比,把回退便利当重要加分项——LoRA 拔插式的回退在生产环境非常值钱。
Q4:RAG 和微调能不能一起用? 能且常见:微调管“怎么干活”(风格、口径、格式),检索管“本次用什么料”(制度、规范、案例)。两者不冲突,组合系统的评估要分别验(检索质量、生成质量)加总验(端到端)。
Q5:买“行业模型”和自己微调一回事吗? 不一样。买行业模型=采购别人的微调产物(数据、口径是人家的,多客户共享);自己微调=用自己的数据和口径定制专属。前者快、便宜、通用性强;后者贴合自己但成本高。判断依据还是同题对照:你的任务上,行业模型 vs 通用模型+自家提示词/检索,差距值不值那个差价(第 4 阶段第 3 课专门展开)。
Q6:微调过的模型还会幻觉吗? 会。微调改善的是特定任务的表现,不改变概率生成的本质(第 1 阶段第 5 课)——该有的引用回查、程序校验、人工复核一样不能少。把微调当“幻觉疫苗”是错误预期。
Q7:规则越加越多,会不会把系统变成“if-else 大杂烩”? 会有这个风险,管理手段是规则也走版本化和测试:每条规则有编号、触发条件、负责人;改动跑回归。规则的价值在确定性和可审计,只要每条规则都能回答“为什么存在”(对应某类真实错误),就不算杂烩;回答不出“为什么存在”的规则,删。
Q8:模型厂商升级底座了,我们的微调要重做吗? 通常要重新验证,多数要重新训练:LoRA 适配层是挂在特定底座上的,底座一换,旧适配层一般不能直接搬过去(以技术方实测为准)。这正是微调容易被忽略的持有成本——采购时问清三件事:底座升级频率、每次迁移重训谁出钱、不升级能不能继续用旧底座。把“升级迁移条款”写进合同,比事后扯皮便宜得多。
自测
第一题:工具三类失败:A 意见书风格不统一;B 引用旧版制度;C 金额加总常错。分别定位层次并给出处理方案。
参考要点(先自己作答,再展开对照)
A 风格不统一 → 微调层(风格固化的正当场景)。先确认前三层已试:提示词写不清“公司风格”(隐性知识);检索无关;规则管不了行文。然后按备忘录流程:800 条人工修订成稿(授权)→ LoRA 微调 → 验收风格一致率 ≥95% + 回归不降 → 不达标回退。
B 引用旧版制度 → 检索/资料层。版本污染:新旧版本同入召回池。修复:检索层默认过滤已废止版本、材料带版本与生效日期、回答强制标注版本。微调解决不了——就算新制度进了权重,旧版还在库里被捞到;且制度改版即需重训,不可持续。
C 金额加总错 → 规则层。纯确定性计算,程序加总校验一行代码,零误差。永远不让模型做算术——模型抽取字段,程序做计算和校验。
答题要点:三层三药,先归因后动手;微调只解决“稳定且说不清”的问题;变化的知识给检索,确定的判断给规则,隐性的风格才是微调的领地。
第二题:供应商说:“我们的行业模型专门为建工微调过,所以不会像通用模型那样产生幻觉。“这句话里有两处问题,找出来。
参考要点(先自己作答,再展开对照)
问题一:微调不当幻觉疫苗。微调改善特定任务的表现(风格、口径、限定任务质量),不改变概率生成的本质(第 1 阶段第 5 课)——微调过的模型照样会幻觉,引用回查、程序校验、人工复核一样不能少。
问题二:“专门微调过”不等于“在你的任务上更好”。没有同题对照,“行业优化”只是形容词。正确动作:要求用我方样本做“行业模型 vs 通用模型+我方提示词/检索”的基线盲测,用数据说话(第 4 阶段第 3 课展开评审方法)。
概念卡片
| 名词 | 一句话定义 |
|---|---|
| 四层改进 | 提示词 → 检索/资料 → 规则 → 微调,成本与风险递增,最低够用层动手 |
| 变化频率定知识归属 | 常变的走检索(活页夹),稳定的习惯口径才微调(装订本) |
| 风格固化 | 微调的典型正当场景:隐性、稳定、提示词写不出的口径 |
| 灾难性遗忘 | 微调导致原有能力退化——全量回归测试是解药 |
| 蒸馏 | 用大模型的优质输出当教材训练小模型——限定任务降本的正当路径 |
| 微调持有成本 | 底座升级适配层通常要重训重验——采购时谈清迁移条款 |
| 决策三问 | 错在哪层 / 最低够用哪层 / 数据、验收、回退是否齐备 |
| 先应用再训练 | 应用期积累真实修正样本,数据够了瓶颈明确了再微调 |
延伸阅读
- 机制参考(LoRA/PEFT 的位置)见第 1 阶段第 3 课;检索层设计见第 2 阶段第 5 课;失败分析方法见第 3 阶段第 1 课。
- 参考:OpenAI Fine-tuning 指南(何时微调、如何准备数据的官方口径),核验于 2026-09-17。各平台微调能力与计价属动态信息,立项时以当时文档为准。
- 数据量与效果因任务而异,以自己样本实测为准;费用以供应商报价+验收挂钩为宜。