AI 课堂

预训练与后训练:模型是怎么练出来的

2026-08-02修订于 2026-09-17

本课结构 点击折叠
  1. 一句话定义
  2. 生活化类比:培养一名法务新人
  3. 本质与能力边界
  4. 实战演练:新《分包管理办法》接入,三条路走一遍
  5. 建工案例:新制度上线的一周
  6. 供应商话术拆解
  7. 常见问答
  8. 自测
  9. 概念卡片
  10. 延伸阅读

预训练打底、后训练塑形、推理时下功夫是三件不同的事。分清它们,才能拆穿“调高思考强度就等于再训练”这类混淆。

本课回答的业务问题:供应商说的“行业微调”“持续预训练”到底改了模型什么?新制度发布后,是微调进去、还是检索出来给模型看?

前置课程:第 2 课(注意力与 MoE)。

读完本课你将能够

  1. 说清预训练、后训练(SFT、偏好优化、RLVR)、推理时计算三个层次各自改了什么、不改什么;
  2. 对“新制度、新规范如何让模型用上”给出三条路线(贴提示词、检索、微调)的选择依据,并把各自代价讲给业务部门听;
  3. 拆解“行业持续预训练”“行业微调”类话术,追问数据、基线、验收、数据安全四个要害;
  4. 厘清 LoRA、SFT、RLHF、PEFT 的关系,不再把它们当成同一维度的选项。

一句话定义

大模型先通过预训练在海量数据上形成基础能力,再通过不同后训练配方(SFT、偏好优化、可验证奖励强化学习等)调整任务表现、推理与行为;部署后在具体任务上还可投入不同的推理时计算三者层次不同,也不是所有模型都走固定流水线。

这句话拆开有四层:

  • “预训练形成基础能力”——一次大规模训练:让模型在海量文本上反复做“预测下一个 token”(第 2 课讲过,这是生成式架构的训练方式),把语言规律、常识和知识轮廓压进权重。基础能力的上限由数据、架构、算力和方法共同决定,不是单要素竞赛。还有一点常被忽略:预训练语料是训练启动前收集的快照——之后发布的制度、规范、价格,天然不在权重里。这是“新知识要靠检索喂给它”的机制根源。
  • “后训练配方”——预训练出来的模型像基本功扎实但不会干活的新人:知识在,交付习惯没有。后训练用不同目标继续训练:SFT 教“活怎么干”,偏好优化按评价标准打磨行为,RLVR 拿可程序判分的结果当奖励。“配方”这个词提醒你:各家各期模型走的路线不同——所以定义的尾句特意说“不是所有模型都走固定流水线”,别把任何一张流程图当成唯一真理。
  • “推理时计算”——部署之后、单次任务之中投入的额外计算(比如更长的思考过程、多方案自查)。关键词是“通常不改权重”:像人接到任务后多花时间检查,不会因为想得久,就自动长出新知识。
  • “三者层次不同”——改输入(提示词)、改资料来源(检索)、改参数(训练)、任务时多算(推理时计算),是四个不同层面的动作。层次分清,供应商话术才混不了你。

生活化类比:培养一名法务新人

环节 类比 需要分清的边界
预训练 广泛读书和练习,建立基础能力 数据、架构、算力和方法共同决定效果
SFT(监督微调) 看带教老师的输入与标准交付,学“活怎么干” 能学任务和知识,但不保证最新、可追溯
偏好优化 / 强化学习 按评价标准反复练习,纠正偏好 标准可来自人的反馈,也可来自程序可验证的结果
推理时计算 接到具体工作后多花时间检查求解 通常不改权重,也补不齐缺失的资料

类比成立在哪:它抓住了层次差别——先广泛打底、再定向塑形(预训练→后训练);“看示范学”和“按评价练”是两种学法(SFT→偏好优化);接到活多花时间检查,不会让一个人自动学会入职后发布的新制度(推理时计算不改权重,也补不齐资料)。最后一格正是拆穿“调高思考强度=学会新制度”的钥匙。

类比失效在哪:其一,人读书会遗忘、会随经历重构知识;模型的预训练权重一经定型,部署后不会自己更新——除非再训练。其二,新人实习表现不会改写他大学读过的书,而模型的后训练直接改在同一副权重上,可能把预训练学过的东西带偏——这就是“对齐的代价”必须实测的原因。其三,人可以边干边学、持续沉淀;模型“干中学”的经验不会自动进权重,想让下次更好,得把经验做成数据再训练。其四,类比里“带教”是实时互动,SFT 用的是事先编好的静态示范数据集,教不了带教现场才暴露的问题。

本质与能力边界

1. 预训练:打底子的那一锤

机制:在海量语料上反复“预测下一个 token”,预测错了就调整参数,最终把语料中的规律压进权重。它决定模型的“地基”——语言流畅度、知识广度、常见任务的基本盘。

供应商口中的“行业持续预训练”(继续预训练)机制其实很简单:不从零炼一个新模型,而是拿现成的通用底座,继续喂大量行业语料(规范、合同、判例)再训一段。它不是骗局——领域语料确实能改变模型的知识分布和语言习惯;但它改的是同一副权重,喂多了可能把通用能力冲淡(业内称“灾难性遗忘”),所以“行业版有没有牺牲通用推理能力”必须用对照测试验证,不能只听宣传。

边界:没有通行的“预训练占总成本 99%“的比例。看到这种数字先问口径:含不含数据采集与清洗、失败实验、上线后的推理服务?口径不同,这个比例没有可比性。另外,预训练是时点的数据快照——“模型知道什么”以训练数据为限,最新的东西不在里面。这不是缺陷,是机制。

2. SFT:学“活怎么干”

机制:编制“输入—标准输出”的示范对(比如“这份签证单的要素抽取结果长这样”),继续训练模型去模仿。SFT 能教会任务套路(怎么审、怎么抽)、表达格式(字段、口径),也捎带一部分知识。

边界:对动态事实(制度、价格、规范版本),把条文微调进权重通常不如外部资料检索好维护——改一条制度就要重新训练、重新验收,而检索只要更新库里的文档。“SFT 管行为、RAG 管资料”是选型经验,不是能力互斥定律:SFT 也能记知识,RAG 也能规范行为,只是维护成本与可靠性各有长短。凡是要逐字准确、可追溯出处的引用(合同条款、规范条文),应当走检索——模型从权重里“回忆”条文,不保证逐字、更不保证出处。

3. RLHF / DPO / RLAIF:按偏好反复打磨

机制:对同一问题的多个回答给出偏好排序,据此调整模型,让好行为更常出现。举个建工味的例子:同一份变更签证,模型给出两版初审意见——A 版结论对但只写“有风险”,B 版逐条指出引用了哪条变更条款、金额怎么算。评审给 B 排前面,这类“排序—调整”重复成千上万次,模型就越来越倾向 B 版那种写法。偏好来源是人(RLHF)、是 AI 评价(RLAIF)都可以,DPO 是偏好优化中的一类方法路线。

边界:它不只管“礼貌拒答”——有用性、格式遵从、详略取舍都在打磨范围。业务上要警惕:偏好优化按“评价标准”优化,评价标准偏了,模型就朝偏的方向使劲——上面那个例子里,如果评审图省事总把“篇幅短的”排前面,模型会学会写得短,而不是写得对。

4. RLVR:程序能判分,才能当奖励

机制:用可程序验证的结果做奖励——代码跑通测试、数学答案核对。判分脚本一旦写好,机器判分成本极低、无疲劳,可大规模反复练习——这正是近年推理类模型快速进步的主力方法之一(见延伸阅读 DeepSeek-R1)。

边界:真实合同风险判断依赖上下文与专业裁量,不能简单照搬自动判分。判分规则写不准,模型会学会“顺着规则得分”而不是“把风险判断做对”——这类“钻奖励漏洞”在强化学习里有专门的名字(奖励 hacking),和应试教育的“考什么练什么”是同一个病。听到“全自动强化学习练出的合同审查模型”,先问:判分规则谁定的、错了怎么办。

5. LoRA 与 PEFT:“改哪些参数”是另一个维度

LoRA 属于 PEFT(参数高效微调):冻结原权重,只在旁边训练一层很小的低秩适配结构——像不动整本定额本,只在旁边夹一叠补充附页。它回答“改哪些参数、怎么改”;SFT、RL 回答“用什么目标训练”。两个维度可以组合:SFT 的训练目标 + LoRA 的参数更新方式,是常见搭配。LoRA 与 SFT 不是上下级关系,更不互斥——“LoRA 是 SFT 的下一级”是常见错误。

6. 推理时计算:想久一点,不等于学进去

部署后,同一个模型可以在难任务上多花计算(更长的推理过程、多方案自查再给结论)。这是任务时的算力投入,通常不改权重:本次想得再久,新制度也不会因此进脑子——新知识靠上下文和检索提供。反过来说,推理时计算对单次任务的质量常有帮助(第 1 阶段第 4 课专门讲它能帮什么、帮不了什么),只是别把“多想”和“再训练”混为一谈。

7. 对齐的代价:后训练可能带来回归

为安全性、合规性做的后训练,可能带来误拒绝(把正常请求当违规拒答)和讨好倾向(顺着提问者的预设说话)等回归——这类代价常被叫作“对齐税”。是否出现、程度多少,须实测——验收集里要专门放边界样本:一条完全正常的分包申请、一个预设错误的追问,看它是坚持口径还是迎合。

实战演练:新《分包管理办法》接入,三条路走一遍

场景(虚构):华岭建设修订《分包管理办法》(QB-ZD-01,虚构示例),重点改了分包审批权限和黑名单条款,要求两周内让合同审查工具用上新口径。

第 0 步:量材料。新办法正文约 2.4 万字,用计数工具实测约 3.1 万 token(示例数字;为什么不按字数换算,见第 1 阶段第 1 课)。

路线 A:贴进提示词(改输入)。每次审查都在指令里附上制度全文。优点:当天生效、零工程、口径百分百可控。代价:每次输入多约 3.1 万 token(按第 1 课示例单价约 ¥0.06/次,钱本身不多),真正的成本是——每次都必须记得带,忘了就退回旧口径;多份制度叠加很快挤占窗口(第 1 阶段第 1 课);制度改版要同步改所有模板。适合:短期过渡、单制度、小范围。

路线 B:RAG 检索(改资料来源)。把制度切成条款块(示例:180 块)建库,每次按问题自动取最相关的 3–5 块(约一两千 token),答案附条款号、版本和生效日期。优点:改版只需换库里的文档;多版本并存可控——本项目 QB-GF-01 质量验收规范就有“2015 修订版与现行版”并存的教学场景(虚构示例),同法处理。代价:要建检索管线、要管版本过滤——检索错版本,等于用废规范。适合:制度频繁变化、多制度并存、要求出处。详见第 2 阶段检索课。

路线 C:微调进权重(改参数)。用示范数据训练(示例:先攒 300–500 条真实审查记录做成“输入—标准结论”对,虚构数字)。适合固化稳定的判断口径与风格(比如“什么算重大风险要上会”)。不适合高频变化的制度文本:办法两个月一修,权重两个月一训,验收两个月一做,成本和风险都不可接受;且训练前必须先有验收集,否则无法证明微调版比“通用版 + 路线 A/B”更好。

决策三问:材料变化频率多高?要不要逐字引用和出处?失败样本攒够了吗?——频率高、要出处,选 B;行为口径稳定且数据充足,再考虑 C;A 永远是当天就能上线的兜底。三条路也常叠加使用:检索管资料、微调管行为、提示词管当天的临时口径,各管一层,互不打架。

建工案例:新制度上线的一周

背景(虚构):青柏产业园试点期间,华岭建设合约部用 AI 工具初筛分包申请。年初公司《分包管理办法》改版:审批权限上调、黑名单新增两家分包单位。通知发出当天,合约部要求“所有申请按新办法筛”。

踩坑(虚构):三天里出了三件事。①一位同事第一天把新办法全文贴进了对话,第二天新开会话接着用,模型按老口径回答——他以为模型“学过了”,其实贴过的材料只活在那一轮对话的上下文里,新会话里并不存在。②有人听说“推理模式思考更深入”,把思考强度调高继续问,答案依旧是老口径——推理时计算通常不改权重,想再久,也想不到没见过的制度。③供应商顺势推销“行业微调套餐”:交 200 条历史审批记录(示例数字),两周交付“懂新办法的专属模型”。合约部差点签约,被一个问题拦住:拿什么证明微调版比“原模型 + 贴全文”更好?双方都拿不出对照数据。

修复(虚构):改走两步——近期用路线 A,把新办法全文和审查要点清单固化成提示词模板入库管理,改版只改模板一处;同步启动路线 B,条款切块入库,标注版本与生效日期,答案必须引用条款号。微调押后:把每天的人工复核结果存成结构化记录,攒失败样本、建验收集,半年后再评估是否值得训练、要不要用 LoRA 这类参数高效方式。

结论:新知识靠“喂”不靠“练”,行为风格才靠“练”;训练立项之前,先有数据、先有验收集——顺序反了,就是花钱买心理安慰。

供应商话术拆解

话术:“我们对模型做了行业持续预训练,深度掌握了建筑领域知识。”

拆解四问,以及合格回答应该长什么样

  1. 底座与数据:底座是哪家、哪个版本?持续预训练的语料构成是什么(规范、合同、案例各多少)、多少量、什么来源、什么授权?“深度掌握”有没有量化口径——在什么测试集上、比底座提升多少?
  2. 基线对比:与“通用底座 + 行业语料检索 + 规则校验”这个朴素基线相比,效果提升多少?用什么样本验收、谁评的分?说不出基线的“深度”,无法排除那点提升其实来自检索而不是训练。
  3. 数据安全:客户数据会不会进入你们的训练语料?隔离与删除机制写不写进合同?
  4. 版本延续:底座升级后,你们的行业层要重做吗?我们已验收的效果会不会变,怎么保证——有没有回归测试和再验收安排?

合格回答应该长什么样:说清底座与版本、语料构成与授权链;给出与朴素基线的对照数字和验收集;数据隔离条款化;底座升级后有回归测试安排。五项齐备,“深度掌握”四个字才有支撑。不合格的信号:只有形容词没有数字;验收样本不透明;客户数据问题含糊其辞;版本升级“到时候再看”。

常见问答

Q1:把公司全部合同微调进去,模型就“记住”每一条了吗? SFT 能让模型学到知识的整体倾向,但不保证逐条精确、可追溯——权重里的“记忆”是概率化的。要“原文第几条第几款”级别的准确,靠检索把原文放进上下文。“SFT 管行为、RAG 管资料”仍是经验口径(见上文边界)。

Q2:微调一次要多少条数据? 没有通行数字,取决于改什么:学个输出格式,少量示范可能就够;固化判断口径,要覆盖各类边界情形的真实样本。数字本身不是重点,验收集才是——没有验收集,多少条都说不清值不值。

Q3:把“思考强度”调到最高,模型是不是就更懂新制度了? 不是。思考强度是推理时计算的投入,通常不改权重——多想能把已有能力用足,但想不到权重和上下文里都没有的东西。新制度要么贴进上下文,要么检索给它。

Q4:LoRA 训出来的东西,会覆盖原模型吗? LoRA 冻结原权重、只训练外挂的低秩适配层——原模型没被改写,撤掉适配层就回到原样。但换了底座版本,旧适配层要对新版本重训、重验,不能直接搬。

Q5:RLHF 是不是就是让模型说话客气点? 不止。礼貌拒答只是一部分,偏好优化同样作用于有用性、格式遵从、详略取舍。把它理解成“客服话术训练”,会低估它对实际工作质量的影响。

Q6:“对齐税”是什么,跟合同审查有什么关系? 指后训练带来的误拒绝、讨好倾向等回归。落到合同审查:可能把正常条款过度预警,也可能顺着提问者的预设走(“这份合同对我们不利吧?”——它顺着说“确实不利”)。是否出现须实测,验收集要放这类边界样本。

Q7:微调和 RAG 到底选哪个? 不是二选一。资料层的更新(制度、规范、价格)走检索,行为层的固化(口径、风格、格式)走训练,两层可以叠加。判断依据回到决策三问:变化频率、出处要求、样本积累。

Q8:花钱微调出来的模型,归谁?换供应商能带走吗? 签约前必须问清的三件事:其一,微调产物(权重或 LoRA 适配层)的归属与交付方式——能不能导出、导出的格式能不能在别的底座上用;其二,底座升级后适配层是否需要重训、谁付钱;其三,训练数据的销毁与隔离条款。LoRA 适配层通常依赖特定底座版本,“拿走适配层”不等于“拿走能力”——换个底座往往要重训重验。这些不问清,所谓“专属模型”可能变成换不动的供应商锁定。

自测

同事说:“LoRA、SFT、RLHF 是三个互斥的选项;把思考强度调高,就等于把新制度训练进模型了。“指出两处问题,并说明让模型用上今天新发布的制度,你会怎么做。

参考要点(先自己作答,再展开对照)

两处错误。其一,“互斥”错位:LoRA 是参数高效微调(PEFT)中的一种参数更新方法(冻结原权重、训练低秩适配层),SFT、RLHF 是训练目标——一个回答“怎么改参数”,一个回答“朝什么方向改”。两者是不同维度,可以组合(SFT 目标 + LoRA 方式是常见搭配),既不互斥,也不是上下级。其二,“调高思考强度=训练”混淆了推理时计算与训练:思考强度高是任务执行时多花计算,通常不改权重;训练是用数据更新权重的专门过程——想得再久,也想不到权重和上下文里都不存在的新制度。我的做法:新制度当天贴进提示词(立即生效、零工程),同时切块入库走检索,答案带条款号、版本与生效日期;是否微调,等积累失败样本、建好验收集后再评估——先用起来、攒数据,再谈训练。

概念卡片

名词 一句话定义
预训练 大规模数据训练基础能力;不存在通用成本占比
SFT(监督微调) 用示范样本学习任务、行为和知识
RLHF 利用人类反馈优化模型行为的一类强化学习方法
RLVR 用可程序验证的结果做奖励;依赖可靠判分,慎用于裁量型任务
LoRA 参数高效微调(PEFT)中的低秩更新方法,可配合不同训练目标
PEFT 参数高效微调的统称:冻结原权重、只训练少量附加参数
推理时计算 任务执行时投入的计算,通常不改权重
对齐税 后训练可能带来的误拒绝、讨好倾向等回归,须实测

延伸阅读

  • 机制参考:DeepSeek-R1 研究LoRA 原论文,核验于 2026-09-16。
  • 缩写速查:SFT=监督微调;RLHF=人类反馈强化学习;RLVR=可验证奖励强化学习;DPO=直接偏好优化;RLAIF=AI 反馈强化学习;PEFT=参数高效微调。
  • 下一课专门讲推理时计算:多想一会儿会更准吗,边界在哪。

← 课程目录