AI 课堂

业务试点与供应商评审

2026-09-17

本课结构 点击折叠
  1. 一句话定义
  2. 生活化类比:样板段施工
  3. 本质与能力边界:试点五件套
  4. 一页决策建议:六个骨架
  5. 实战演练:把试点数据组装成一页建议
  6. 建工案例:成品示例页(虚构)
  7. 供应商评审的完整流程(收官整合)
  8. 供应商话术拆解(收官版)
  9. 常见问答
  10. 自测(毕业题)
  11. 概念卡片
  12. 延伸阅读
  13. 写在课程结尾

全课程的收束:怎么设计一个可验收、可停止、责任清晰的试点;怎么把技术判断翻译成管理层能拍板的一页建议。这是学完 21 课后你应该交付的东西。

本课回答的业务问题:怎么向公司提议“上 AI”而不背锅?试点怎么设计才能出真结论?什么条件下应该停?

前置课程:全部(本课是毕业课,综合运用)。

读完本课你将能够

  1. 设计一个带成功标准、对照组、停止条件的试点方案(五件套);
  2. 把试点数据组装成管理层能直接拍板的“一页决策建议”;
  3. 组合前 21 课的方法,形成从供应商书面初审到试点验证的完整评审流程。

一句话定义

业务试点 = 用最小可行范围验证三件事:效果真实(验收集)、成本可算(完全成本)、责任清晰(人机分工与停止条件);产出物不是“演示”,而是一页包含继续/调整/停止建议的决策报告。

先辨析三个常被混用的状态——演示(demo)、试点(pilot)、上线(production):演示是“挑好的案例给你看”(证明可能性,不证明稳定性);试点是“真实范围、真实数据、真实用户、预设标准”(证明可行性,含失败可能);上线是“全面铺开、纳入日常运维”(承担生产责任)。三个状态的验收标准完全不同,最常见的管理事故是把“演示很成功”直接当“可以上线”——相当于看了样板间就发竣工证书。

试点的独特价值恰恰在于它允许失败:小范围、有预设标准、有停止条件,失败的成本被设计得很低,而失败换来的信息(这个任务/这家供应商/这个流程不行)价值很高。不允许失败的试点不是试点,是押注。

生活化类比:样板段施工

试点 = 样板段施工:正式大面积施工前,选一个典型区段先做——目的是在风险可控的范围里验证工艺(质量达标吗)、核定工效(成本和工期怎么算)、暴露问题(工序衔接哪里卡)。

样板段的三个纪律,对应试点的三个纪律:

  1. 验收标准先行:样板段开工前,“什么叫合格”已经写进方案(垂直度允许偏差、观感标准)——不是干完再讨论标准。对应试点的成功标准先行(第 3 阶段第 1 课);
  2. 有观察期和量化记录:每天记录工效、返工、材料损耗,不是“大家感觉不错”。对应试点的对照组与数据记录;
  3. 不达标就不推广:样板段失败,结论就是“工艺要改”,没有人会说“都干一半了,硬着头皮全干吧”。对应试点的停止条件——没有停止条件的试点,最后都会变成“已经投了这么多,再看看吧”的沉没成本泥潭

类比失效处:样板段验证的主要是工艺(技术),试点验证的还有组织因素——人愿不愿意用、复核流程接不接得上、责任怎么划。所以试点的评估里“人的因素”(使用率、复核耗时、投诉)和技术指标同样重要。技术上成立、组织上落不了地的试点,结论一样是失败——只是病因不同,药方也不同(改流程而不是改模型)。

本质与能力边界:试点五件套

1. 范围最小化:一个场景、一个部门、有限数据

  • 一个业务场景:合同初审或制度问答,二选一(这两个是建工企业最常见的高价值低风险起点)。第一个场景怎么挑?四条筛选标准:高频(每月几百次,几周就能攒出评估数据)、规则可述(“什么叫对”写得出来,才定得了成功标准)、错了有人兜底(AI 漏判有人工复核接着,不直接对外)、数据可及(材料就在手里,不用先做三个月数据治理)——四条缺一条,先补课再试点。反对同时开三个试点:管理带宽、评估纪律、数据治理都被稀释,最后三个都拿不出干净结论;
  • 一个部门、有限用户:志愿参加的部门优先(被动参与的部门会把“不好用”当政治结论);用户 5–10 人足够出数据;
  • 真实但有限的数据:数据量够评估用(几百份任务),但不承诺全库接入——数据接入本身有治理成本(第 3 阶段第 3 课),试点期只接必需的;
  • 周期:一般 6–12 周——短了数据不够(边界场景撞不上),长了组织疲劳。范围内的一切“先小后大”,扩范围是试点结论之后的事。

2. 成功标准先行:把数字写进方案再开工

标准从哪来?从业务痛点来,不从技术能力来

场景 痛点 成功标准(示例,虚构数字)
合同初审 漏检高风险条款;复核慢 高风险召回 ≥ 95%(50 条验收集);复核耗时下降 ≥ 25%;误报率 ≤ 20%
制度问答 制度口径乱、找文件慢 答案依据命中率 ≥ 90%(引用回查);拒答率 ≤ 10%;平均响应 p95 ≤ 8 秒

三条纪律:①每条标准可测——“提升用户体验”不是标准,“复核耗时下降 25%“才是;②漏检和误报成对出现——只定召回不定误报,系统会用海量误报换召回(第 3 阶段第 1 课的取舍);③签发时数字就定死——方案评审会上各方签字,防止结果出来后”标准再议”。

3. 对照组:没有对照的“效率提升”都是感觉

  • 组间对照:AI 辅助组 vs 纯人工组,同批任务类型,比工时、质量、成本——人少时可以流水线式对照(前 200 份纯人工、后 200 份 AI 辅助,同班组);
  • 基线对照:用历史数据当基线(过去三个月人工平均复核耗时)——次优但可行,注意任务分布是否可比(疫情期间的合同和正常时期不可比);
  • 必须记录的对照数据:任务量、耗时(分环节)、质量(错误率、返工率)、成本(人工 + 模型 + 运维)。“大家觉得快多了”出现在总结里,说明试点失败了——感觉不是数据。

4. 停止条件:红线先画,触发即停

停止条件写在方案里,长这样(虚构示例):

  • 质量红线:高风险条款漏检 > 2 项且无法归因修复;
  • 效率红线:人工复核时间连续两周不降反升;
  • 成本红线:月完全成本超过人工基线 1.2 倍;
  • 安全红线:发生数据外泄事件或注入造成的实际操作事故(零容忍,立即停);
  • 组织红线:用户实际使用率 < 30%(系统空转,说明流程没接上)。

触发即停,不讨论沉没成本——这条要在启动会上对所有人明说。停止不等于失败:“这个场景该停”是试点最有价值的结论之一,它帮你避免了一次全公司的错误推广。

5. 责任边界:人机分工写进操作规程

  • AI 初审 + 人终审(第 1 阶段第 5 课):AI 负责初筛、抽取、证据定位、草稿;具名的责任人负责重大结论、例外裁量、对外交付;
  • 对外的每份文件都有具名人:AI 生成的审查意见以“辅助意见”身份进流程,法务签字才是正式意见;
  • 事故响应:出错时回查什么(日志、版本、样本)、多长时间内定责(先恢复业务再复盘)——写进规程,别等事故发生再吵。

一页决策建议:六个骨架

试点结束,给管理层的不是 PPT 大会,是一页纸

【结论】继续推广 / 调整后二期 / 停止 —— 一句话,可执行、有边界
1. 业务问题与试点范围(一句话 + 范围数字)
2. 结果:验收集表现(数字)、对照组对比(数字)、失败案例与归因
3. 完全成本:模型 + 人工复核 + 运维 + 风险成本(一张表)
4. 责任与合规:人机分工、数据边界、审计安排
5. 风险与停止条件:剩余风险清单 + 下一阶段红线
6. 请决策事项:预算、编制、授权范围(具体到数字和岗位)

为什么是一页?因为管理层拍板拍的是“数字 + 边界 + 请示事项”,不是技术。一页纸逼你把 21 课学到的东西压缩成可决策的信息:第 2 段是第 3 阶段第 1 课(评估),第 3 段是第 3 阶段第 4 课(完全成本),第 4 段是第 3 阶段第 3 课(安全治理),第 5 段是本课的停止条件。写不满一页说明数据不够,写超过一页说明你还没想清楚。

实战演练:把试点数据组装成一页建议

场景(虚构):青柏项目 AI 合同初审试点 3 个月,原始记录如下——范围:采购部,月均 1,142 份真实合同;高风险条款验收集 50 条,召回 49(漏 1 项:背靠背条款变体);误报率 18%;人工耗时:对照组(历史基线)2.1 人日/百份 → AI 辅助组 1.5 人日/百份;模型费 ¥0.4 万/月,运维 0.2 人力;安全:注入测试 8 条拦截 6(2 条未拦,由人工终审兜底);漏检项归因:公司口径无书面定义(第 4 阶段第 2 课的“口径缺失”);数据:本地检索,未出域。

组装过程(五步):

  1. 定结论行:数据支持“有价值但有一个可修复的缺口”——结论不是“全面推广”也不是“停止”,是”调整后二期:扩至标准采购合同,撤出争议解决条款场景“(可执行、有边界);
  2. 挑结果数字:效率(2.1 → 1.5 人日/百份,约 -29%,历史基线口径)、质量(49/50,漏检项已归因为口径缺失、可修复)、误报(18%——如实报,附“二期目标 ≤15%”);失败的 1 项必须写——藏着它的建议经不起追问,写出来反而证明你有归因能力;
  3. 算完全成本:人工基线 = 2.1 人日/百份 × 11.42 百份 × ¥800 ≈ ¥1.92 万/月;AI 组 = 模型 ¥0.4 万 + 复核人工(1.5 × 11.42 × ¥800 ≈ ¥1.37 万)+ 运维 0.2 人力(约 ¥0.35 万)≈ ¥2.12 万/月,约为基线的 110%——如实写:试点期模型和运维的固定成本还没被业务量摊薄,账上“贵了一成”。价值论证放在质量端(召回 49/50 防住的高风险敞口远超每月约 ¥0.2 万的净增成本)和摊薄空间(二期纳入标准采购合同、业务量翻倍后,固定成本占比减半,预计降至基线的九成左右)。成本数字必须能从原始记录复算——把 110% 包装成“已省钱”的建议,经不起一次追问;
  4. 写责任与边界:AI 初筛出疑点清单,法务终审签字;数据本地检索不出域;日志留存六个月;
  5. 定请示事项:二期预算 ¥X、采购部接口人 1 名、口径制定由法务部牵头(把“我需要什么”写成具体岗位和数字,管理层才好批)。

成品见下。

建工案例:成品示例页(虚构)

【结论】建议调整后二期:范围扩至标准采购合同;争议解决条款场景暂不覆盖,待口径成文后纳入。

1. 问题与范围:采购合同初审漏检高风险条款、复核耗时高。试点:采购部,3 个月,月均 1,142 份真实合同(虚构数字)。 2. 结果:①效率:复核 2.1 → 1.5 人日/百份(-29%,历史基线对照);②质量:高风险召回 49/50;③误报率 18%(二期目标 ≤15%);④漏检 1 项(背靠背条款变体),归因:公司口径无书面定义——已列整改(法务部牵头出口径,2 周内)。 3. 完全成本(月):模型 ¥0.4 万 + 人工复核 ¥1.37 万 + 运维 0.2 人力(约 ¥0.35 万)≈ ¥2.12 万,约为人工基线(¥1.92 万)的 110%——试点期固定成本未摊薄,暂未省钱;二期扩量后预计降至基线九成左右。 4. 责任与合规:AI 出疑点清单,法务终审签字;合同数据本地检索、不出域;调用日志留存 6 个月。 5. 风险与红线:剩余风险——背靠背变体(口径整改后复测);注入样本 2/8 未拦(人工终审兜底,二期增加程序校验)。二期红线:漏检率 > 1%、误报连续两周上升、月成本超人工基线 → 触发即停。 6. 请决策:二期预算 ¥X/年;采购部接口人 1 名;法务部牵头制定《背靠背条款审查口径》(2 周)。

注意这页纸的样子:全是数字、动作和边界,没有一个“赋能”“引领”“智慧”。这不妨碍它有说服力——恰恰相反,数字和红线才是管理层敢签字的东西。

供应商评审的完整流程(收官整合)

把第 3 课的四问十二查和本课的试点框架接起来,就是完整的供应商评审流程:

① 书面初审(四问十二查发函)→ 淘汰明显不合格
② 同题盲测(我方评估集,2–3 家)→ 用数据排座次
③ 试点验证(本课五件套,可作合同一部分)→ 真实环境验真伪
④ 商务谈判(退出条款、验收挂钩付款)→ 把前面的发现变成合同保护

顺序不能乱:先试点后尽调,沉没成本会替供应商说话——你已经习惯它的界面、迁就它的流程,批判性判断力直线下降。同样,付款结构跟验收挂钩:盲测达标付 X%、试点达标付 Y%、全量部署稳定运行三个月付尾款。

供应商话术拆解(收官版)

话术:“先全面上线,跑起来再优化,效果肯定越来越好。”

逐问拆解:

  1. “全面上线的失败代价你承担什么?”——要写进合同的:效果不达标的退款/赔偿、数据事故的责任。口头承诺的“负责到底”在法务眼里等于零;
  2. “为什么不能先试点?”——不接受试点验收的公司,在怕什么?(试点是对双方的保护:他真有实力,试点只会证明它。)拒绝试点的合理理由极少;
  3. “’越来越好’的机制是什么?”——谁标注、谁迭代、多久一次、用什么验收(第 4 阶段第 2 课的数据积累机制)?没有机制的“越来越好”是一厢情愿;
  4. “上一家客户全面上线后数据给我看看。”——脱敏后的效果数据和费用结构。拿不出任何一家全量客户的,“成熟方案”从何谈起。

合格回答应该长什么样:“建议贵方先试点:范围、成功标准、停止条件我们配合制定;付款按盲测/试点/稳定运行三段挂钩;上线后每月效果报告含误报率和成本;已签 N 家全量客户,经授权可提供 X 家的效果数据摘要。”

话术:“试点免费,效果好了再谈钱。”

逐问拆解:

  1. “试点期我的数据怎么用?”——免费试点的真实对价常常是你的数据:合同文本进了谁的库、会不会被留权训练、试点结束删不删(第 3 阶段第 3 课)。“免费”两个字不回答这些问题,协议必须回答;
  2. “试点结束后系统、配置、数据怎么交接?”——免费期攒下的提示词、知识库配置、流程习惯都在供应商环境里,谈崩了能不能带走?带不走的“免费”是锁定,不是优惠;
  3. “收费方案现在就给。”——试点期不谈钱,等于放弃筹码最足时的谈判权:等你全部门用顺了手,对方的报价单才第一次出现。

合格回答应该长什么样:“试点支持费 ¥X(或限范围免费),数据仅用于本次服务、不留权训练、结束后 N 日内删除并出证明;配置与数据可导出;正式报价现在提供,试点达标后按此执行。”——免费的试点最贵:你付的不是钱,是数据、习惯和谈判筹码。

常见问答

Q1:试点失败了怎么跟领导交代? 换个框架:试点的产出是“结论”而不是“成功”。拿出一页建议,写清“该场景不适用,原因是 X(归因数据),建议转向 Y 场景或优化 Z 后再试”——这是合格的交代。真正要交代不了的,是没定标准、没对照组、跑了一堆感觉就下结论的试点:失败都不知道败在哪。

Q2:领导要求“直接全面上线,别搞试点”,怎么办? 给他算两笔账:①失败账——全面上线后效果不达标的代价(全员工时、数据迁移、商誉)对比试点的 6 周和有限范围;②责任账——没有成功标准和停止条件的全面上线,出了事故责任无法切分。再用“样板段”逻辑说:行业里没有不经样板段就大面积施工的总包。多数情况下,把试点压缩到 6 周、范围一个部门,是能谈下来的折中。

Q3:试点期该不该让供应商深度参与? 该参与、不该主导。供应商提供部署支持、答疑、配合整改——但评估集、评分、对照组数据必须我方掌握(利益相关方不能既当运动员又当裁判)。合同里写明:试点数据双方共享,评估集归我方。

Q4:对照组怎么设?人都说忙不过来,没人愿意纯人工对照组。 退而求其次用“基线对照”:取试点前 3–6 个月的历史人工数据(工时、质量、返工),要求任务分布可比。再辅以“流水线对照”:同班组前 200 份人工、后 200 份 AI 辅助。完美的对照难得,够用的对照常见——比“没有对照强”,永远成立

Q5:一页建议写不下怎么办? 写不下的原因通常是两个:数据没算清(去算清),或不敢下结论(回去看停止条件和归因)。一页纸之外的细节(完整评估表、失败样本清单、成本明细)放附件——正文一页定决策,附件备查。领导问细节时你能翻到附件第几页,本身专业度的体现。

Q6:试点结论是“继续”,下一步预算怎么估? 按推广路径分段估:二期(扩一个部门)→ 全公司(含数据治理、培训、运维编制)→ 持续运营(模型费、评估复测、版本管理)。每段都带自己的成功标准和停止条件——推广不是一次放权,是多次验证

Q7:AI 初审出错了,谁担责? 试点方案第 5 件套(责任边界)就是回答这个的:AI 输出以“辅助意见”身份进流程,正式意见有具名人签字——错在 AI(漏检)算系统改进项,错在复核(签字人没看)是人的责任。先划清再上线,不要等事故后倒推;涉具体法律责任的情形,按公司制度和专业意见处理。

Q8:跟供应商签试点协议,必须写进哪几条? 五条底线:①评估集归我方——评分权是试点的命门;②数据条款——数据仅用于本次服务、不留权训练、结束后限期删除并出具证明(第 3 阶段第 3 课);③费用与付款挂钩验收——盲测/试点/稳定运行分段付,不一次性预付;④退出与交接——配置、知识库、数据可导出,谈崩了能带走;⑤保密与事故责任——数据事故的责任划分写清楚,口头“负责到底”无效。缺一条,试点就成了供应商的主场。

自测(毕业题)

你在公司推动 AI 合同初审试点 3 个月:月均 1,142 份合同,AI 辅助组人工耗时 1.5 人日/百份(人工基线 2.1),高风险召回 49/50,误报率 18%。写出一页建议的“结论行”和三条支撑数字,并给出一条停止条件。

参考要点(先自己作答,再展开对照)

结论行(示例):“建议调整后二期:扩至标准采购合同;争议条款场景待口径成文后纳入。”——三要素:方向(继续)、范围(扩到哪)、边界(哪不碰)。“全面推广”“效果良好”这类无边界结论都不合格。

三条支撑数字:①效率:2.1 → 1.5 人日/百份(-29%,注明对照组口径——历史基线);②质量:高风险召回 49/50,漏检 1 项已归因(口径缺失,可修复)——失败项写出来,附归因和整改动作;③成本:完全成本 ≈ ¥2.12 万/月,约为人工基线(¥1.92 万/月)的 110%(模型 + 复核 + 运维合计口径)——如实呈现“暂未省钱”,把价值论证放在质量端和二期摊薄空间;算成“已经省钱”的成本数字,从原始记录复算一遍就会露馅。

停止条件(示例):“二期中高风险漏检率 > 1%,或误报率连续两周上升且无归因修复,即回退人工流程。”——要素:指标、阈值、动作(回退)、不带“视情况讨论”的活口。

加分项:把请示事项写成具体数字和岗位(预算 ¥X、接口人 1 名、口径制定牵头部门)——管理层拍的是资源,不是情绪。

概念卡片

名词 一句话定义
演示/试点/上线 挑好案例 / 真实范围验证 / 生产责任——验收标准完全不同
试点五件套 范围最小化、成功标准先行、对照组、停止条件、责任边界
停止条件 事先画红线,触发即停不谈沉没成本——“该停”也是有价值的结论
完全成本 模型 + 人工复核 + 运维 + 风险成本的总账(第 3 阶段第 4 课)
一页决策建议 结论行 + 数字 + 边界 + 请示事项——管理层拍的是数字不是技术
四步评审流程 书面初审 → 同题盲测 → 试点验证 → 商务谈判,顺序不能乱

延伸阅读

  • 本课无新概念,是全课程 22 课的综合运用;按各课“延伸阅读”回查动态信息的核验方法。
  • 课程至此完结:从“AI 是什么”到“一页决策建议”,贯穿始终的三条纪律——先定义成功、以实际结果验收、责任始终有人。

写在课程结尾

22 课走完,你手里应该有五样东西:一张能拆解任何 AI 概念的知识地图、一套评估和验收的纪律、一个能算清账的成本框架、一份问不倒的供应商提纲、一页能拍板的决策建议。技术会变、模型会换代,但这五样东西的底层逻辑长期有效——先定义成功、以实际结果验收、责任始终有人。祝你在自己的项目里用出真结论。

← 课程目录