AI 课堂

推理时计算:多想一会儿就更准吗

2026-09-17

本课结构 点击折叠
  1. 一句话定义
  2. 生活化类比(建筑行业版)
  3. 本质与能力边界
  4. 实战演练:同一任务、两种档位的对比实验
  5. 建工案例:结算争议的两个问题
  6. 供应商话术拆解
  7. 常见问答
  8. 自测
  9. 概念卡片
  10. 延伸阅读

部分模型允许在回答前投入更多“思考”计算。它买到的是时间和质量的可能性,不是事实和附件——这是推理模型时代最容易混淆的边界。

本课回答的业务问题:“推理模型”“深度思考模式”多花的钱和时间,买到了什么、没买到什么?复杂任务该不该默认开最高档?

前置课程:第 3 课(预训练与后训练)。

读完本课你将能够

  1. 说清推理时计算与训练改参数的区别,拆穿“把思考强度调高等于再训练”这类混淆;
  2. 判断一类任务适合低档还是高档——按任务的推理链长度与约束核对需求分流,而不是按感觉全开最高档;
  3. 设计一次“同一任务、两种档位”的对比实验,用成功率、延迟、每成功任务成本三个数做决策;
  4. 记住推理档位买不到的三样东西:缺失的事实与附件、确定性计算的正确性、时效。

一句话定义

推理时计算指模型在一次任务中投入的推理计算量;部分模型允许调节(如思考档位),它可能提高复杂问题的质量,同时增加等待时间与费用。它与训练改参数是两回事。

这段定义每个术语都容易被讲混,逐个拆开。

“一次任务中投入”——这笔计算发生在回答这一次请求的过程里,用完即弃:这次多想了一会儿,下次并不会更聪明。能沉淀的只有训练改的权重(见第 1 阶段第 3 课)。

“推理计算量”与“思考档位”——部分产品允许发起任务时指定投入多少“思考”,叫法不一(“深度思考”“推理模式”等;名称与计价随版本变化,以当时文档为准)。投入更多的直观表现,是模型在给出最终答案前先展开一段较长的内部推演,再收口成答案;推演消耗算力和时间,也按用量计费——“档位越高、越慢越贵”由此而来。

为什么升档更贵,值得说透:那段内部推演本身也是逐 token 生成的,计入输出计费,而输出 token 的单价通常高于输入(口径随平台与版本变化,以当时文档为准)。所以升档贵在两处——推演更长,且长的部分单价更高。材料很长、结论很短的任务里,这个差异尤其明显:你以为买的是一句话的结论,账单上是一整页“草稿”。

“可能提高……同时增加”——因果不对称:质量提升是“可能”,要实测才知道;时间和费用的增加是“确定”,账单上看得见。买到的是质量的可能性,付出的是确定的等待与成本——本课所有决策口径都由此出发。

生活化类比(建筑行业版)

一位完成培训的造价工程师接到复杂结算争议(虚构示例):多给时间,他可以交叉核对更多签证单、做更多方量复核——质量可能提高。但签证单原件缺失时,给他一周也编不出真实工程量;混凝土方量这种确定性计算,他多“沉思”反而不如直接按图计算。

类比成立在哪:第一,“时间换质量”对“材料齐全、需要多步交叉核对”的活确实成立——争议梳理这类任务,多核一轮就少漏一处;第二,“原件缺失编不出”对应推理买不到事实——推演是对已有材料的加工,不是材料的生产;第三,“方量直接按图算”对应确定性计算交给程序——工程上没人靠“沉思”算方量。

类比失效在哪:第一,工程师多想几次会沉淀经验,下次同类争议直接上手;模型的推理计算不沉淀——第四十七份签证想完,第四十八份照样从头想起,因为权重没变;第二,工程师想到一半会主动说“这个资料我缺”,模型可能推演了很长却不报告前提缺失,甚至顺手把缺的数补成“看起来合理”的数(那是下一课的幻觉);第三,工程师的思考过程事后可复盘,模型展示的“思考过程”不能当审计底稿(见第 3 节)。

本质与能力边界

1. 买到什么:多步推理与约束核对类任务“可能”受益

有一类任务的成功取决于把多个条件串起来核:结论要对照条款、签认链、时间节点几条线,同时满足多个约束,错一步全错。低档下模型容易“一口气给答案”——中间步骤没展开,某步看漏,整个结论跟着偏。更多推理计算给模型留出“打草稿”的空间:先拆条件、逐条核对,再收口成答案;草稿越长,单步疏漏被后续步骤纠正的机会越多——这就是“多想一会儿可能更准”的机制。

但“可能”不是客套话:受益取决于任务的推理密度——单步能完成的活(抽字段、判类别),草稿再长也变不出新信息;且结论必须落在自己的任务上实测——同一模型,争议梳理升档受益,台账抽取可能毫无差别。怎么实测,见实战演练。

同一份结算材料里就有现成对照(虚构示例):“从 47 份签证里抽出单号、金额、签字人”是单步活,低档足够;“这 9 份争议签证的签认链是否符合合同变更条款、缺口在哪”要串起条款、时间、签认三条线——后者才是升档候选。判据一句话:需要“对着多条线索交叉核对”的任务才可能受益,“照单抓取”的任务不受益。

2. 没买到什么:缺失的事实、确定性计算、时效

推理时计算是“对已有输入的加工”,这个定位决定三样东西它买不到。

买不到缺失的事实与附件。输入里没有的信息,推演一万步也生产不出来。“付款比例详见附件二”而附件未提供——这是资料问题,不是推理问题。此时升档,好的行为是模型仍标记“附件缺失、比例待补”;坏的行为是它按“常见比例”补一个数——后者就是幻觉(见第 1 阶段第 5 课)。对应的工程动作只有一个:退回补件。

买不到确定性计算的正确性。金额合计、比例换算、天数计算,模型的做派是概率续写,不是精确运算(见第 1 阶段第 1 课:字符级精确操作是它的弱项)。多想一会儿不会把概率续写变成计算器。举个具体数(虚构示例):厂房区 C30 泵送混凝土约 12,400 m³,结算时按不同部位、不同单价分段连乘再累加——模型口算这类长链算术,错在某一位上并不罕见,而且错得毫无征兆:没有报错、没有犹豫,答案和算对了一样自信。正确分工:模型列式、程序出数、模型复述结果——谁算都一样,没必要挑不稳的那位算。想,不能代替查;算,不能代替程序。

买不到时效。档位越高等待越久、费用越高。结算会议现场等三分钟出不来结果,高档答案再准也来不及;隔夜批处理多等几分钟没人在乎——延迟预算和成本一样,是选档决策的输入。

3. 长解释不等于正确:推理输出的两重不可靠

高档模式常输出一大段“思考过程”,看起来工作极其认真,这里立两条纪律。

第一,长解释不等于正确。解释长度反映投入的计算量,不反映结论的证据质量。结论对不对,仍要核验证据:条款是否存在、数字与原文是否一致、前提是否都成立。一段冗长推演收口在一个没有原文依据的结论上,仍然是错的——而且因为过程详尽,更容易骗过复核者。

第二,展示的思考过程不是内部计算的真实记录。机制上两层原因:其一,产品界面展示的“思考”常经过摘要或改写,未必是完整的内部过程;其二,即使完整展示,那段文字也是一段生成物——“想得对”与“说得对”之间没有机制保证,训练优化的是答案对不对,不是独白忠不忠实。所以它不能当作模型内部推理过程的忠实记录,更不能当审计底稿归档。要留痕,留输入材料、输出结论、原文引用,不是那段独白。

4. 选型口径:按任务分流,三个数说话

常见的成本策略是:日常抽取、分类用低档甚至不开推理,复杂争议分析才升档。依据不是省钱美德,而是任务性质——推理密度低的任务,升档买不到质量,只买到等待和账单。

“我们这个任务算不算复杂”不能拍脑袋,要对比实验说话,口径三项:成功率——同一批任务、同一成功标准,两档各成功多少;延迟——平均等待和最慢一次,对照业务延迟预算;成本——每成功任务成本,总费用除以成功任务数(不是任务总数,失败重跑的钱要摊进去)。三个数一起看才能回答“升档值不值”。做决策时再补一条加权:把成功率差换算成错误代价。漏标一个证据缺口,谈判桌上可能让出去几万几十万;而升档多花的是每条几毛钱(见实战演练的示例数)。错误代价高的任务,成功率差几个百分点就值回价差;错误代价低、量又大的任务,同样的差值未必划算。评估的通用方法见第 3 阶段第 1 课,成本口径展开见第 3 阶段第 4 课。

5. 推理不改权重:“多想想”学不会新制度

最后把边界钉死:推理档位再高,也不改模型的权重——权重只在训练时改变(见第 1 阶段第 3 课)。想让模型用上今天新发布的《分包管理办法》(虚构示例),路径是把制度文本放进上下文或接入检索,不是把思考强度调到最高“让它想进去”。同理,这周处理了一百份签证,第一百零一份并不因此更熟练。识别“越用越懂你”话术时记住:那是上下文积累,不是模型变了。

实战演练:同一任务、两种档位的对比实验

任务背景(虚构):青柏产业园结算阶段的争议梳理(贯穿案例 QB-JS-01)。要回答:这类任务值不值得升到最高档?不靠感觉,靠数据。

第 1 步,定样本和成功标准。从争议池取 30 个争议点,涵盖两类争议(虚构示例)。先写检查表再开跑:成功 = 双方主张列全、依据条款引对且能回查、证据缺口逐项标出,三条全满足才算成功——标准先于实验,避免事后放水。

第 2 步,单变量对照。同一批任务跑两遍:低档组(不开或最低档)与高档组(最高档)。除档位外全部固定——同一模型、同一提示词、同一套材料。变量不止一个(比如同时换了模型),数据就没法归因。

第 3 步,填费用延迟记录表。(表中数字均为示例数字、虚构,只为演示填法)

记录项 低档组 高档组 填表口径
任务数 30 30 同一批争议点,各跑一遍
成功数 19 26 按检查表逐条人工判定
成功率 63% 87% 成功数 ÷ 任务数
平均等待 约 40 秒 约 3 分钟 从发出请求到输出完成
最慢一次 约 1 分钟 约 5 分钟 对照业务的延迟预算
本轮总费用 ¥5.8 ¥19.4 按平台账单口径记,含失败重跑
每成功任务成本 ≈¥0.31 ≈¥0.75 总费用 ÷ 成功数,不除任务数
人工复核揪出的错 11 处 4 处 记类型:低档多为漏缺口,高档多为过度推演

填表要点:费用按账单口径整组记,别现场心算单价(计费口径随平台和版本变化);每成功任务成本一定除以成功数——成功率低时,“单价便宜”会被返工吃掉;错误类型要记,两档错法不同,复核策略才好定。

第 4 步,做决策。示例数据的读法:成功率 63%→87%,返工减少;每成功任务成本涨到约 2.4 倍;平均等待 3 分钟、最慢 5 分钟。这类任务量不大、错误代价高——结论:升档,但写明延迟预算 5 分钟。反过来对抽取类任务(问法 A)做同样实验,示例结果两档成功率 96% 对 97%,差别只在等待和账单——结论:低档。

读数提醒:30 个样本差 24 个百分点,方向足够清楚;如果只差两三个百分点,先别下结论——那可能只是抽样噪声,把样本扩大或把判定标准收紧再跑一轮。样本量小不可怕,可怕的是把小样本的噪声当成结论写进制度。

第 5 步,落成制度。把结论写进“任务分级表”:任务类型、档位、延迟预算、成功标准、存档位置;模型或价格变了,用同一张表重测。

建工案例:结算争议的两个问题

青柏产业园一期 EPC(虚构,合同价 3.2 亿元、工期 540 天)进入结算阶段,合约部用 AI 工具处理结算争议(QB-JS-01,虚构材料):一类是变更签证金额争议——47 份签证中 9 份双方金额口径不一致(虚构示例);另一类是工期延误责任争议——合同工期 540 天基础上延误 62 天的责任划分(虚构示例)。同一个争议池,两种问法:

  • 问法 A(低推理档即可):抽取全部变更签证的单号、日期、金额、签字人,列表并给出原文位置——结构化抽取,快而便宜;低档批量跑,程序汇总,人工按比例抽查;
  • 问法 B(值得升档):对照合同变更签证条款与实际签认链,梳理论证双方主张的依据与缺口,标记待补证据——多步推理,多花的时间和钱可能值得。

踩过的坑(虚构示例):上线第一个月,团队图省事全线开最高档。月底复盘发现:抽取类任务两档成功率几乎没差别,而等待和账单明显上去——47 份签证的批量抽取等了一个下午。修复:按实战演练的方法补做对比实验,把任务分成“抽取汇总(低档)“与”争议分析(升档)“两级写进操作规程。先问任务性质,再选档位;两类任务都保留证据引用,最后都由人复核。

供应商话术拆解

话术:“我们的系统搭载推理模型,深度思考保证审查结论准确。”

逐问拆解:

  1. “保证”拿什么兜底?——要验收数据:什么样本、什么口径的成功率,与不开推理的基线差多少——没有基线,分不清是档位的功劳还是模型本来就会;
  2. 推理档位的延迟和费用,报价体现了吗?——高档的等待和账单是确定代价。把业务约束报给对方(分钟级还是小时级可接受、一天多少批量),看方案在真实约束下还成不成立;
  3. 缺失材料、错误材料场景测过吗?——深度思考买不到事实。附件缺失、扫描件模糊、材料互相矛盾,这三类场景系统是标记待补,还是“深度思考”出一个编造的答案?
  4. 留痕留的是什么?——如果方案把模型展示的“思考过程”当审查底稿归档,这本身就是风险信号(见本课第 3 节)。合格的留痕是输入材料、最终结论、原文引用三样,经得起回查。

合格回答应该长什么样:拿得出同一测试集上“开/不开推理”两组数据,成功率、延迟、成本齐全;说得出哪些任务建议不开推理——敢说“不用”的比全场景推最高档的更可信;对缺材料场景能描述系统行为(标记待补、拒绝作答);延迟和费用增量写进报价;留痕方案存结论与证据引用,不把那段“思考独白”当底稿。

常见问答

Q1:思考档位是不是越高越好? 不是。档位买到的是可能性,付出的是确定的等待和费用;抽取、分类用低档甚至不开,多步推理类任务再考虑升档,“算不算复杂”用实验确认,不靠猜。

Q2:“推理模型”和普通模型是两种东西吗? 通常指经推理能力强化训练、或支持调节推理投入的模型(见概念卡片)。差别一部分在训练配方(见第 1 阶段第 3 课),一部分在产品是否开放档位调节;名称与计价随版本变。

Q3:思考强度调高,模型会不会慢慢学会我们的业务? 不会。推理通常不改权重,推演用完即弃;产品显得“越来越熟”,是把历史对话放进了上下文——重新读档案,不是学会了。

Q4:模型输出的“思考过程”能存档当审查底稿吗? 不建议。它不是内部计算的真实记录,只能当线索;留痕存输入材料、最终结论、原文引用——这三样经得起回查。

Q5:升档大概贵多少,有通用倍数吗? 没有。费用取决于任务长度、推演长度和平台计价口径(各产品不同且随版本变化);可靠办法是拿自己的任务实测(见本课实战演练)。

Q6:我们任务量小,也要做对比实验吗? 方法不变,规模缩小:先用低档全量跑,人工挑出错误集中的复杂任务,只对这一小撮做升档试验;同任务、同材料、同提示,只改档位。

Q7:等多久算等不起? 业务问题:会议现场支持一两分钟就是上限,隔夜批处理半小时无所谓。把每类任务的延迟预算写进任务分级表,选档时对照执行。

Q8:开最高档,是不是就不会幻觉了? 不会。升档可能减少“疏漏型”错误——步骤展开后,漏看的条件有机会被后续步骤兜住;但幻觉是生成机制的伴生问题(见第 1 阶段第 5 课),材料里没有的东西,高档照样可能“推演”出一个看起来合理的答案,而且包装得更像深思熟虑。档位改变不了核验纪律:结论回查原文,数字回查计算。

自测

付款条件审查时发现附件缺失(付款比例“详见附件二”但附件未提供)。把思考强度调到最高能否解决?你会怎么处理?

参考要点(先自己作答,再展开对照)

不能解决。推理时计算是对已有输入的加工,附件缺失是资料问题不是推理问题——输入里不存在的信息,推演再长也生产不出来;升档只买“已有材料内的推理质量”,买不到事实。指望“多想想”,还要提防它顺着常见比例补个数——那就是幻觉。

正确处理分四步:第一,抽取结果把付款比例标记为“未提及/缺附件待补”,不留空、不猜测;第二,保留“详见附件二”的原文位置作依据,让复核者看到缺口在哪;第三,列入待复核事项,退回补件;第四,补件后重跑抽取,核对与主合同、补充协议是否冲突(本项目口径:主合同预付款 20%,一份补充协议写 30%——虚构示例;冲突要显式暴露,不能默默取其一)。

概念卡片

名词 一句话定义
推理时计算 回答或执行任务时投入的计算量,与训练改参数不同
思考档位 部分产品允许调节的推理投入;影响质量、等待时间与费用
推理模型 经推理能力强化训练或支持推理时计算的模型,输出仍需核验
每成功任务成本 评估推理档位是否值得的单位:一次成功交付摊到的总费用(含失败重跑)

延伸阅读

← 课程目录