选型不是选“最强的模型”,而是选“任务性价比与约束下最合适的组合”。成本要按完整任务算,延迟要看分位数值,开放权重不等于免费。
本课回答的业务问题:云 API、本地部署、混合方案怎么选?每次审查到底花多少钱?“开源自部署更省钱”对不对?
前置课程:第 3 阶段第 1–3 课。
读完本课你将能够:
- 用四个成本口径(单次调用 → 完整任务 → 每成功任务 → 完全成本)算清一笔账;
- 读懂 p50/p95 延迟指标,判断服务体验能否过关;
- 按“约束筛选 → 同题对照 → 完全成本 → 退出条款”的流程做一次完整的模型与部署选型。
一句话定义
模型选型 = 在质量、成本、延迟、安全合规、运维能力五个约束下求任务性价比最优解;成本核算的单位是每成功任务的成本(含重试、工具、人工复核),不是每千 token 的单价。
这句话反常识的地方在于“五个约束”:日常讨论里大家只比“哪个模型聪明”(质量一个维度),但采购决策是五个维度的联合求解——数据敏感的场合,质量第一的模型可能直接出局;没有运维团队的公司,本地部署的“省钱”是幻觉。先明确哪几个约束是硬的(不可让步),再在剩下的维度里优化,这是选型的第一步,也是很多人跳过的一步。
生活化类比:选施工方式
| 方案 | 建工类比 | 适合 | 代价 |
|---|---|---|---|
| 云 API | 商品混凝土——按方采购,随用随结 | 需求波动大、团队小、快速起步 | 单价含服务费;数据出域要评估;涨价不可控 |
| 本地部署(含开放权重) | 自建搅拌站——产能自己握着 | 数据敏感、用量大且稳定、有运维团队 | 重资产:硬件 + 运维人力 + 升级成本;权重有许可条件 |
| 混合 | 主体用商品混凝土 + 局部自建 | 核心数据走本地、常规任务走云 | 两套都要养,架构和权限更复杂 |
这个类比值得展开,因为它精确对应了三类认知误区:
- “自建搅拌站省钱”——只算料差价(token 单价差),不算搅拌机折旧(显卡/服务器)、搅拌车和司机(运维工程师)、场地和电(机房/电费)、以及产量不足时的闲置。自建省钱的前提是方量够大且稳定、管得好——两家搅拌站的用量去自建,纯属为情怀买单;
- “商品混凝土质量不可控”——方向说反了:正规搅拌站的质检体系(模型的持续训练、红队测试)比大多数工地自建的更完善。真正的问题是原材料(数据)要拉到别人家里——这就是数据出域,解法是分级(第 3 课)和商务条款,不是一刀切自建;
- “先自建,以后想换就换”——搅拌站建起来之后,围绕它的运输调度、配比习惯、质检流程都会长出来(提示词、流程、评估集围绕特定模型调优)。换站要重做适配——退出成本在进场时就要谈好。
类比失效处:混凝土是标准品,模型不是——同一任务不同模型的质量差异可能很大,所以选型必须“同题对照”(第 1 课),不能像选水泥标号一样看参数表下单。
本质与能力边界
1. 成本的四个口径:从“单价”到“真账”
口径一:单次调用成本。一次 API 调用的费用 = 输入 token × 输入单价 + 输出 token × 输出单价(+ 推理/工具等按平台规则另计)。两个可优化点:①缓存——重复出现的输入前缀(固定系统提示、常驻制度库文本)命中缓存通常按折扣计费,长前缀场景收益明显(缓存规则、命中率以平台文档为准);②输入瘦身——别把“反正窗口够”的整本台账塞进去,输入是计费的大头。
口径二:完整任务成本。一次业务任务 ≠ 一次调用。合同初审一个任务可能是:解析 1 次 + 抽取 2 次调用(主调用 + 校验重试)+ 检索 5 次 + 汇总 1 次。任务成本 = 这条链上所有调用的总和,外加工具侧的数据库/OCR费用。只看单次调用价,会严重低估任务真实开销。
口径三:每成功任务成本。= 总费用 ÷ 验收通过的任务数(第 1 课的公式)。这是决策口径:A 方案 1000 次调用全成功、B 方案 1200 次调用(含 200 次返工)成功同样多任务——B 的单价可能更低,但每成功任务成本更高。一切“便宜”最终都要折算到这个数。
口径四:完全成本。= 模型/工具费 + 人工复核 + 运维人力 + 失败返工 + 风险成本(漏检造成的损失敞口 × 概率)。经验和案例都指向同一个结论:人工复核往往大于模型费——第 1 课的算例里复核人工是模型费的五倍以上。这意味着优化重点常常是“提高首次达标率、减少复核量”,而不是再压模型单价。
一句话记住:报价单上的单价是“料钱”,每成功任务成本才是“工程造价”——采购按后者比价。
2. 延迟:看分位数,不看平均值
供应商报“平均响应 2 秒”时,问一句:p95 是多少?
- p50 = 一半的请求快于这个值(中位数);p95 = 95% 的请求快于这个值;
- 假设 100 次请求里 95 次是 2 秒、5 次是 40 秒:平均值 ≈ 3.9 秒(看着还行),p95 = 40 秒(真实体感)。平均数会掩盖长尾,而用户记住的恰恰是长尾;
- 建工版:混凝土供应报“平均 30 分钟到场”——但第 20 车等了 3 小时,那车料到场已近初凝,这层浇筑只能返工。平均值负责报平安,长尾负责出事故;
- 判断标准跟业务走:内部工具 p95 30 秒可能可接受(跑批);坐席辅助场景超 10 秒就影响使用(人等不起);
- 流式输出(先生成先显示)改善等待体感,但不缩短总时长——“看起来快了”和“真的快了”是两回事,验收时按总时长和首字延迟分别记。
3. 容量与并发:演示很快,上线为什么变慢
演示环境里一个用户、一份文件,当然快。真实环境是早高峰:合约部十几个人同时上传合同,还有人在跑批量台账。延迟飙升的机制有两层:
- 排队:推理服务的并发容量有上限(云 API 有速率限制,本地部署受显卡与显存硬约束),请求数超过容量就排队——p95 最先恶化,平均值最后才动;
- 长文本放大:输入越长,单次请求占用的算力和显存(KV cache,见第 1 阶段第 2 课)越大,同样容量能同时服务的请求越少——一份 300 页的总包合同,一个人就能吃掉好几个人的份额。
所以容量问题要用三个数字问清楚:目标并发数下的 p95、速率限制(每分钟请求数/token 数上限)、超限后的行为(排队还是直接报错)。验收要在峰值并发下压测,别在空载环境里签收——空载的快,是展台上的快。
4. 开放权重的三个“不等于”
开放权重(可获得模型权重文件、自行部署的模型)常被简化成“免费 + 安全 + 自主”,三个都不成立:
- 不等于免费商用:开放权重 ≠ 开源软件。权重文件按许可证授权,各家的条件不同——能否商用、能否改造后对外提供服务、是否要求署名或开源衍生作品、能否用于特定行业——逐条读许可证,拿不准找专业意见。另外“免费拿到权重”和“免费跑起来”是两回事:推理要算力;
- 不等于低运维成本:部署(选推理框架、做量化)、监控(服务挂了谁半夜爬起来)、升级(新版本出 bug、安全补丁)、容量(并发高峰扩容)——全是人力。没有运维团队的公司,这部分成本通常远超预期,而且以“事故”的形式结算;
- 不等于效果可控:自部署不自动等于质量好;换了量化精度要重新验收;版本升级可能引入回归(第 1 课回归测试的适用场景)。“权重在自己手里”给你的是可控性和数据不出域,不是质量的保证书。
5. 退出与版本:写进合同的两条
- 退出迁移:换供应商/换模型时,四样东西必须能带走——提示词与流程配置、评估集(这是你的资产,验收的尺子)、业务数据、微调产物(如有归属约定)。评估集在谁手里,谁就握着重选的主动权——这条要写进合同,不是退场时再谈;
- 版本变更:云 API 的上游模型会升级,效果可能漂移。合同写明:重大版本变更提前通知、配合重测、提供回退或固定版本选项(如平台支持)。自部署同理:升级窗口、验收责任、回滚方案。
6. 选型决策流程(五步)
- 定任务与验收标准(第 1 课):指标、样本、合格线——没有这个,后面全是空谈;
- 列硬约束:数据出域限制、信创/国产化要求、延迟上限、预算上限——硬约束先筛掉一批候选;
- 同题对照:候选方案用同一批样本盲测,记质量、延迟、单次成本;
- 算完全成本:按口径四填表对比(含人工复核与风险成本);
- 小规模试点(第 4 阶段第 4 课):真实环境、真实数据量、真实用户,带停止条件。
没有“最强模型”,只有“这个任务、这些约束下性价比可接受的组合”。忘了这句话,就会被每次新模型发布牵着走,评估集年年重跑、系统年年迁移。
实战演练:“月审 2000 份合同”的三方案测算表
场景(虚构,单价均为示例单价,虚构数字,实际以官方报价为准):青柏产业园所在公司要上合同初审,月均 2,000 份,平均每份输入 3 万 token、输出 3 千 token。云 API 旗舰模型示例单价:输入 ¥0.008/千 token、输出 ¥0.024/千 token;轻量模型输入 ¥0.001、输出 ¥0.003。
第一步:单次调用成本。
- 旗舰:0.008×30 + 0.024×3 = ¥0.312/份;轻量:0.001×30 + 0.003×3 = ¥0.039/份——差 8 倍;
- 开缓存:系统提示与制度库前缀(约 1 万 token)固定,旗舰模型缓存输入示例价按 1 折(¥0.0008/千):每份省 (0.008−0.0008)×10 = ¥0.072,旗舰实付约 ¥0.24/份。开缓存这一个动作,旗舰月费从 ¥6,240 降到 ¥4,800。
第二步:完整任务成本。旗舰一次过(重试率 5%):≈ ¥0.25/份;轻量返工多(重试率 30%,返工按半价上下文缓存):≈ ¥0.045/份。仍是轻量便宜。
第三步:每成功任务成本。拿第 1 课式的验收做分母:旗舰 950/1000 达标,轻量 800/1000 达标(误报和漏检都多):
- 旗舰:0.25 × 2000 ÷ 1900 ≈ ¥0.26/成功份,月 ≈ ¥530;
- 轻量:0.045 × 2000 ÷ 1600 ≈ ¥0.056/成功份,月 ≈ ¥113——但 400 份不达标的要人工全审;
第四步:完全成本(月,人工 ¥800/人日,示例值)。设人工全审 1 份 ≈ 0.2 人日,AI 辅助复核 1 份 ≈ 0.05 人日:
| 方案 | 模型费 | 复核人工 | 未达标补审 | 月合计 | 备注 |
|---|---|---|---|---|---|
| 旗舰+缓存 | ¥530 | 1900×0.05×800 = ¥76,000 | 100×0.2×800 = ¥16,000 | ≈ ¥92,530 | 质量稳 |
| 轻量+规则 | ¥113 | 1600×0.05×800 = ¥64,000 | 400×0.2×800 = ¥64,000 | ≈ ¥128,113 | 补审吃掉全部差价 |
| 本地(2 卡+运维) | 折旧+运维 ≈ ¥10,000 | 达标率同旗舰 ¥76,000 | 同旗舰 ¥16,000 | ≈ ¥102,000 | 数据不出域 |
结论浮出来了:三个方案的人工成本都是大头(¥76,000 起),模型费差异(¥113–10,000)几乎不影响总账;轻量模型省下的模型费被补审成本反噬——最便宜模型反而跑出了最贵总账,比旗舰每月贵约 3.6 万。真正的优化杠杆是提高首次达标率、压缩复核量——这笔账不看完全成本根本看不见。另外注意本地方案的”¥10,000”还没算进机房电费、故障风险和升级费用,真实数字只会更高。
做完任何一份测算,自查五条:①成本口径是否算到了“每成功任务”(还是停在单价);②人工复核是否按达标/未达标分开算(未达标那份要全审,贵 4 倍);③延迟数字是空载平均值还是峰值并发下的 p95;④本地报价是否含运维人力与折旧(不含就是半截账);⑤退出与版本条款谈了没有。五条里有一条答不上,这份测算先别上会。
建工案例:一次选型会的两个反转
青柏项目选型会(虚构),预印的对比表只列了三家模型的价格和“基准测试分数”。会议进程两个反转:
- 反转一:技术负责人补了一页延迟实测——报价最便宜的方案,高峰期 p95 总时长拖到 60 秒,首字延迟也远超坐席场景 10 秒的要求。便宜方案在延迟约束上直接出局,价格表作废重排;
- 反转二:法务提了数据分级——涉及未公开投标策略的合同不允许出域。排名第一的境外云 API 无法签出满足要求的数据条款。硬约束又一次改写排名。
最终中选的不是“跑分最高”也不是“最便宜”的,而是延迟达标、数据条款可签、每成功任务成本居中的方案。五个约束联合求解,每一次“反转”都是某个被忽略的约束浮出水面。
供应商话术拆解
话术:“开源自部署,一次投入终身免费,还数据安全。”
逐问拆解:
- 许可证:哪个模型、哪个版本、许可证允许商用吗?改造后对外服务允许吗?把许可证名称写进合同;
- 运维账:硬件折旧 + 运维人力 + 电费机房,按我的用量摊到单次任务是多少?故障响应 SLA 和费用?“终身免费”的运维是谁终身免费——你还是他;
- 效果账:与云 API 同题对照的数据?量化到几比特(量化影响质量和速度,见第 1 阶段第 2 课),量化后的质量验收过吗;
- 升级账:模型出新版谁升级、要不要重新付费验收?安全补丁谁打;
- 退出账:用了两年想换,数据和评估集带走没问题吧——那请把这句写进合同。
合格回答应该长什么样:“许可证是 X(可商用、允许改造,附原文链接);按贵方 2000 份/月的量,硬件加运维摊销约每份 ¥Y,三年期对比云 API 的盈亏平衡点在月 Z 份;量化 INT8 后在我们样本上质量下降 N%,完整对照数据在附录;升级每年 X 次由我方负责并重新跑贵方评估集;退出时评估集和数据全量导出,写进合同第 X 条。”
常见问答
Q1:缓存到底能省多少? 取决于固定前缀占比。系统提示+制度库占输入大头的场景(合同审查正是),缓存命中部分按折扣计费,省 30%–70% 输入费不罕见(示例范围,以平台规则为准)。但缓存通常有时效(过期重新计费),也有最低前缀长度要求——开启前读一遍平台的缓存规则。
Q2:买断制(一年固定费随便用)是不是比按量划算? 看用量稳定性。用量稳定且接近满负荷,买断划算;用量波动大或处于验证期,按量更安全(买断的钱沉没了,验证失败不心疼)。让供应商两种报价都出,按你的真实用量曲线算期望值,别被“不限量”的爽感带偏——不限量的方案通常在并发、速率上有暗坑。
Q3:国产模型和海外模型怎么选? 本课程不给排名。给检查清单:中文任务用自己的样本实测(公开榜单不代跑你的任务)、可用地区与服务条款、数据条款(是否留权训练、出域限制)、开放权重与许可、部署选项、价格。五个维度打分对比,而不是看发布会情绪下单。
Q4:数据敏感是不是必须本地部署? 不一定,分级处理(第 3 课):核心商务合同可以本地或签严格数据条款的云通道,普通材料走常规云。全量本地是最贵方案,通常混合更优。“必须全部本地”很多时候是没做分级的偷懒结论。
Q5:换模型的成本到底在哪? 三块:提示词/流程适配(不同模型的口径差异)、评估集重跑(必须,第 1 课)、权限与集成重配。所以评估集和提示词要作为资产版本化管理——迁移成本 = 半天重跑评估 + 若干天适配,而不是从零再来。
Q6:试点期用云 API,以后再迁本地,可行吗? 常见且合理的路径——先用 API 验证业务价值(第 4 阶段第 4 课试点),量起来后再评估本地。前提是现在就做好两件事:评估集独立于任何模型(任务口径定义清楚)、数据结构不绑死单一平台(导出格式开放)。迁移路径是设计出来的,不是到时候想办法。
Q7:为什么感觉每次新模型发布,我们的系统又要重选一遍? 因为评估集没有沉淀为资产、选型没有流程。有评估集 + 五步流程,新模型发布只意味着“跑一遍对照,数据说话”——一两天的事;没有这套机制,每次都是重新吵架。
Q8:用云 API,供应商会拿我的合同数据去训练模型吗? 不能默认“会”,也不能默认“不会”——看条款,不看感觉。问清三件事:①服务协议里你的数据是否被用于训练或改进模型(不少平台对企业级 API 默认不用于训练,但消费级产品和企业接口的口径经常不同,以你签的那份条款当时文本为准);②数据留存多久、存在哪里、能否要求删除;③能否另签数据处理协议并约定违约责任。拿不到书面承诺的,按第 3 课的分级处理——敏感数据不出域。书面条款永远比销售口头承诺可靠。
自测
试点测算:某方案月费 3,000 元跑 1,000 个任务,920 个达标;人工复核每百个任务 2 人日(800 元/人日,示例值)。算每成功任务的完全成本。指出两个还没算进去的项目。
参考要点(先自己作答,再展开对照)
分步计算:
- 模型费:3,000 元;
- 人工复核:1,000 × 2% × 800 = 16,000 元(每百个 2 人日 → 每千个 20 人日);
- 每成功任务完全成本 =(3,000 + 16,000)÷ 920 ≈ 20.7 元/成功任务——人工是模型费的 5 倍以上,模型费根本不是主要矛盾;
- 还没算的:①失败返工与二次处理成本(80 个未达标任务的补救);②漏检风险成本(未达标里的错误分布——若含高风险漏检,按损失敞口 × 概率折算可能远超其他项);③运维、监控、数据治理的固定投入;
- 优化启示:提高首次达标率(920 → 980)对总成本的改善,大于把模型费砍半——先优化复核量,再谈换便宜模型。
概念卡片
| 名词 | 一句话定义 |
|---|---|
| 四个成本口径 | 单次调用 → 完全任务 → 每成功任务 → 完全成本,决策看最后一个 |
| p50/p95 | 一半/95% 请求快于该值;平均数掩盖长尾,体感由 p95 决定 |
| 容量与并发 | 演示快不算数;峰值并发下的 p95、速率限制、超限行为才算 |
| 缓存 | 固定输入前缀的折扣计费,长系统提示场景的首要省钱动作 |
| 开放权重 | 可自行部署的模型;商用看许可、省钱要算运维、效果须重验收 |
| 退出迁移 | 评估集、提示词、数据带得走——选型时谈,写进合同 |
| 五步选型流程 | 定标准 → 列硬约束 → 同题对照 → 完全成本 → 试点 |
延伸阅读
- 价格、窗口、许可条款属动态信息,选型时按官方渠道现查并记录日期(本课核验日期:2026-09-17;本课方法长期适用)。
- 参考:Artificial Analysis(第三方模型价格、延迟、质量对比站点,可作同题对照前的粗筛,数字以各平台官方为准),核验于 2026-09-17。
- 试点设计见第 4 阶段第 4 课;数据分级见第 3 阶段第 3 课。