“建筑行业垂直大模型”是采购里最常见也最容易被话术带偏的品类。用前面的全部知识,拼出一张完整的评审地图。
本课回答的业务问题:怎么判断一个“行业大模型”的真实含金量?开放权重自己部署和买垂域服务,分别适合谁?“自研”的水分怎么看?
前置课程:第 0 阶段第 2 课(分层)+ 第 3、4 阶段各课(本课综合运用)。
读完本课你将能够:
- 分清“开放权重、开源软件、闭源 API”三个常被混用的词;
- 用“四问十二查”评审任何“行业大模型”方案,每查都知道看什么、红旗是什么;
- 把评审从“听宣讲”改造成“书面初审 → 同题盲测 → 试点验证”的流程。
一句话定义
开放权重指可获得模型权重文件、自行部署的模型(开放权重 ≠ 开源软件,许可证条件各异);垂域模型指面向特定行业任务训练/优化的模型或服务。评审它们的核心不是名词,而是四个可验证问题:底座是什么、数据是什么、效果凭什么、退出怎么走。
先修三个词的混淆——这是本课的地基:
- 闭源 API:模型在厂商云上,你按量调用。模型不是你的,你是“买混凝土的”;
- 开放权重:权重文件可以获取,自己(或委托)部署运行。类似“拿到配比和设备的搅拌站图纸”——但能不能商用、能不能改造后对外卖,看许可证,不是“拿到就能随便用”;
- 开源软件:通常指源代码开放、按开源许可证授权的软件。大模型即便开放权重,训练代码、数据、完整流程未必开放——所以严谨的说法是“开放权重模型”,不是“开源大模型”。这三个词在商务谈判里被故意混用:供应商说“我们是开源的”,可能只是“基于开放权重”,也可能连权重都没有只是调 API——三种情况的资产价值完全不同。
生活化类比:买“定制生产线”
买“行业大模型”像买装配式构件厂的“建筑行业定制生产线”。市场上三种货:
- 真定制:标准生产线基础上做了深度改造——换了行业专用的模具(微调)、调了工艺参数(训练配方)、有质检报告(评测数据)。贵,但确实贴行业;
- 贴标牌:标准生产线一条没改,贴了个“建筑行业专用”标牌,附一本操作建议(提示词模板)。便宜,但你买到的“行业含量”就是那张标牌;
- 租车间代工:自己没有生产线,接单后转到别人车间加工(API 转发),赚个差价。无所谓好坏,但“我们是自研”这句话在三种情况下含义完全不同——评审就是把三种区分开。
类比失效处:生产线买了就在那儿,效果看得见摸得着;模型的“改造深度”看不见,只能靠证据验证——数据清单、对照测试、盲测样本。所以模型采购比设备采购更依赖“让对方拿出可验证的东西”,也更容易被话术滑过去——这正是要建立评审地图的原因。一句话记住:设备采购看货,模型采购看证据。
本质与能力边界:四问十二查
第一问:底座之问——“自研”在哪一层?
查 1|底座与版本。底座模型是哪家、哪个版本?这个信息决定三件事:能力上限(底座强则上限高)、升级联动(底座换代行业层要不要重做)、商务依赖(底座方停服/改价怎么传导)。红旗信号:“自研底座、与主流无关”——从零训底座的成本极高(第 1 阶段第 3 课),绝大多数所谓自研底座经不起追问;拿不出底座信息的,直接按“来路不明”处理。核实方法并不技术:要求对方出具模型卡(model card)或部署说明——开放权重底座的名称、参数规模、许可证都能在公开发布渠道核对(以发布方当时文档为准);对不上的,红旗成立。
查 2|改造方式。全参数微调 / LoRA 等参数高效方法 / 仅提示词工程 / 仅检索增强?这正对应第 4 阶段第 2 课的“四层改进”——从提示词到微调,越往下越贵、越慢、越难回退。改造深度决定“行业含量”的真实构成:LoRA 微调的行业模型和“通用模型+行业提示词”的差距,可能远小于价格差距——这正是要用同题对照验证的。红旗:说不出训练方式的(“核心机密”是托词,可以签保密协议后尽调)。
查 3|底座升级联动。底座出新版,行业层(微调、适配)要不要重做?谁做、谁付费、多久?红旗:“我们永远用当前版本”——承诺无法兑现;或“升级免费自动完成”——微调产物无法自动迁移到新底座,“自动”背后多半是悄悄换成了通用新版,行业优化丢失。
第二问:数据之问——行业能力从哪来?
查 4|训练数据构成。多少条、什么类型(合同/规范/造价文件)、什么任务(抽取/审查/问答)、怎么清洗标注?量和质都要看:12 万条标注条款和 12 万条网页文本的“行业含量”天差地别。红旗:“海量工程数据”但给不出构成明细——海量可能是低质的遮羞布。
查 5|授权链。数据从哪来(自有/客户授权/公开)、客户数据进不进训练、有没有书面承诺?这条不过,后面全停——你的合同数据若无声无息进了他的模型,再卖给你的竞争对手,损失无法追溯(第 3 阶段第 3 课)。
查 6|知识更新机制。规范改版、制度更新怎么跟进?正确答案必须有检索侧设计(热更新、当周生效);答“重新训练”的,追问频率、周期、费用——规范一年数改,按季重训既贵又滞后。红旗:更新机制缺失或含糊——买回来那一刻就是它最“新”的一天。
查 7|数据代表性。训练数据偏房建,你的任务是市政/装饰/电力——覆盖偏差要当面确认,最好用你的样本验证(见查 9)。
第三问:效果之问——凭什么说更好?
查 8|同题对照基线。与“通用模型 + 行业提示词/检索”的对照数据——这是十二查的核心。没有这条,“行业优化”四个字无法证伪。对照要公平:同一批任务、同一评分标准、双方都允许合理调优。红旗:只报绝对分(“准确率 92%”)不报相对差距(比通用基线高多少)——绝对分可能是任务简单的结果,不是行业含量的结果。
查 9|我方盲测。用自己出的题、自己的标注口径,测一遍——不接受“只看供应商的报告”。样本构成照第 3 阶段第 1 课:典型 + 边界 + 失败三类,保留测试不外泄。供应商推脱“没有环境现场测”的,警惕。
查 10|通用能力回归。行业训练后通用任务退化多少(灾难性遗忘,第 4 阶段第 2 课)?你的系统不是只干行业任务的——制度问答、通用文书都会用。红旗:只谈行业提升、绝口不提通用退化。
第四问:退出之问——资产归属与迁移
查 11|四样资产归属。提示词与流程配置、评估集、业务数据、微调产物(权重/适配层)——退出时哪些能带走?评估集必须是你方的(验收的尺子,重选的筹码,第 3 阶段第 4 课)。
查 12|迁移成本。换底座/换供应商时:数据格式开放吗?集成要重做多少(第 2 阶段第 7 课连接器锁定)?行业层能不能移植到新底座?把答案写进合同,退出条款不是退场时的谈判筹码,是进场时的。
四问的关系:底座问“是什么”,数据问“凭什么”,效果问“真的吗”,退出问“散场呢”。四问全过才进商务谈判,缺一问都是给未来埋雷。
自部署还是买服务:先看三个前提
业务问题的另一半——开放权重拿回来自己部署,还是直接买垂域服务——不由技术情怀决定,由三个前提决定,按顺序过筛:
- 合规前提(硬约束):合同、造价数据按你所在法域和公司制度能不能出域?不能出域时,自部署(或专有云)不是“选项”而是“唯一解”,比较到此为止;
- 能力前提:自部署意味着自己(或托管方)承担 GPU 服务器、版本升级、安全补丁、7×24 运维——买下的不是模型,是一支要长期养着的运维队伍;没人接得住,就别碰;
- 经济前提:调用量足够大且长期稳定时,自部署的固定成本才可能摊薄到低于 API 按量计费;用量小或波动大,买服务几乎总是更划算(完全成本口径见第 3 阶段第 4 课)。
合规先筛掉一批,能力再筛掉一批,剩下的才轮到算账——顺序反了,就会为一个养不起的方案谈半年价格。
实战演练:一份宣传材料的初审
场景(虚构):收到“筑智大模型”宣传册(虚构名称),核心宣称:“深耕建筑行业多年,海量工程数据训练,自研行业底座,业内领先,准确率 95%。“按四问十二查做书面初审:
第一轮:书面质询(发函清单,节选)
| 查项 | 我方问题 | 对方答复 | 初审结论 |
|---|---|---|---|
| 查 1 底座 | 底座模型与版本? | “基于开放权重底座 v3 二次开发”(迟疑后) | “自研底座”宣称不实,降级为“开放权重+行业层” |
| 查 4 数据 | 数据构成(类型/量/任务)? | “数十万条行业文档” → 追问后:约 3 万条合同条款标注 + 公开规范 | “海量”缩水,但 3 万条标注尚可 |
| 查 5 授权 | 客户数据是否进训练? | “签补充协议可排除” | 可接受,条款入合同 |
| 查 6 更新 | 规范改版机制? | “季度重训 + 知识库热更新” | 检索侧存在,及格线 |
| 查 8 对照 | 与通用基线对照? | 只报绝对分 95% | 核心缺口:进入盲测再判 |
| 查 11/12 退出 | 评估集/微调产物归属? | 未答复 | 合同谈判必答题 |
第二轮:同题盲测。我方出 60 题(40 典型 + 12 边界 + 8 带注入,其中高风险条款相关 50 条),对照两边:筑智 vs “通用模型+我方提示词+我方检索”。结果(虚构数字):高风险条款召回 46/50 vs 44/50(微弱优势);边界题(冲突条款处理)6/12 vs 4/12(有差距);注入题 6/8 vs 7/8(反而略差);通用任务回归:文书起草 3 题中 2 题风格退化。
数字怎么看:46/50 是 92%,44/50 是 88%——但 50 道题的样本上差 2 题,基本落在统计噪声范围内,单凭总分不能宣布“胜出”。真正可读的信号在错误构成:边界题 6/12 vs 4/12 方向一致,说明边界处理可能是真差距;注入题反而落后,说明安全不是它的卖点。样本量不够时两个补救:追加同类题目复测;或干脆放弃“总分定胜负”,改看“哪类题赢、哪类题输”——后者对谈判更有用,因为你谈的不是分数,是为你的高风险场景多出来的那部分能力值多少钱(评估方法见第 3 阶段第 1 课)。
第三轮:结论。行业层有真实但有限的价值(边界题 +2),通用有退化,注入防护不占优;结合报价高出通用方案 40%——结论不是“买/不买”二选一,而是“按盲测结果重新谈价 + 合同补齐退出条款 + 灰度试点先跑低风险场景”。这份初审把一个宣传驱动的决策,改造成了证据驱动的谈判。
建工案例:三家“行业大模型”的评审速写
青柏项目收到三家方案(虚构,价格相近),四问十二查的浓缩结果:
| 维度 | 甲:真微调 | 乙:提示词封装 | 丙:API 转发 |
|---|---|---|---|
| 底座(查1-2) | 开放权重 v3 + LoRA 微调 | 开放权重 v3 原样 | 某云 API 转发 |
| 行业数据(查4-5) | 3 万条标注合同条款(授权可查) | 无训练,行业提示词模板 | 无 |
| 对照数据(查8-9) | 与通用基线 +9%(附样本),接受盲测 | 拿不出,接受盲测 | 拿不出 |
| 更新机制(查6) | 季度重训 + 检索热更新 | 检索侧 | 随上游变,不承诺 |
| 退出(查11-12) | LoRA 产物可交付,评估集归客户 | 模板可交付 | 仅数据导出 |
过程也踩过坑(虚构):第一轮图省事,用供应商提供的演示题做初测,三家分数都漂亮、几乎分不出高下;换成我方自出样本后差距才显形——演示题落在对方的舒适区里,自出题才是你的战场(这也是查 9 坚持“我方盲测”的原因)。
评审结论不是“甲最好”这么简单:若盲测显示你的任务与通用基线差距 <5%(多数标准化抽取任务如此),乙的性价比可能最高——省下的钱投到检索和评估上,收益更实在;甲的价值在边界场景(冲突处理、专业语感)和退出资产(LoRA 归属);丙只在“快速起步、不想建任何能力”时成立,且退出最差。每一格都要有答案,每一格都改变商务谈判的姿态——这张表就是你的谈判地图。
供应商话术拆解(综合版)
话术:“我们深耕建筑行业多年,模型经过海量工程数据训练,业内领先。”
逐问拆解:
- “海量”:多少条、什么构成、什么任务、授权链?“数十万”到“三万”的缩水过程要在第一轮质询里完成;
- “业内领先”:第三方评测还是自评?和我方盲测结果一致吗?“领先”不接受形容词,接受盲测数字;
- “深耕多年”:团队里有多少人懂建筑业务(不是懂销售)?行业知识库谁维护、更新频率?
- “准确率 95%”:什么任务、什么口径、谁标注、多少条(第 3 阶段第 1 课全套追问)?高风险子集单独多少?
- 反问测试:主动问“什么场景你们不适合?”——答不出的供应商没做过真实边界;答得出“我们不适合 X,建议 Y 方案”的,反而加分。
合格回答应该长什么样:“底座是 X v3 + LoRA;数据 3 万条标注合同条款(构成明细见附录、授权链可查、客户数据不进训练入合同);与通用基线对照 +9%、盲测欢迎;通用回归显示 2 项任务小幅退化(数据附后);规范更新走检索热更新;退出时 LoRA 产物与评估集归属客户(合同第 X 条);我们不适合的场景是 Z,那种情况建议直接用通用模型加贵方自建检索。”
常见问答
Q1:开放权重能不能改了以后对外卖服务? 看许可证,各家条件不同:有的允许商用和对外服务、有的限制特定用途、有的要求衍生品同许可。逐条读原文,拿不准找专业意见,把许可证名称和关键条款写进采购文件。不要信口头解释——许可证以文本为准。
Q2:垂域模型是不是智商税? 不是一刀切。标准化程度高、通用模型+好提示词就能到 90 分的任务,垂域溢价常常不值;边界场景复杂、专业语感重要的任务,真微调的垂域有真实价值。判据永远是同题盲测的差距 + 差价,不是品类信仰。
Q3:小团队没人懂技术,怎么盲测? 三样东西不需要技术背景:真实任务样本 50 条、标注口径一页纸、双人独立打分——这本身就是第 3 阶段第 1 课的小评估集。找两个业务熟手一个下午就能跑完。业务判断力就是你的测试能力,别被“要有算法工程师才能测”吓住。
Q4:国外模型和国内“行业模型”怎么平衡? 检查清单不分国界:中文任务实测(用自己样本)、可用地区与服务条款、数据条款(出域、留权训练)、开放权重与许可、部署选项、价格。另加一条合规硬约束:按你所在法域和行业监管要求先筛(涉密、信创要求等),硬约束先于一切技术比较。
Q5:供应商说“评估集我们出”——能用吗? 只能参考,不能作数。他的评估集可能恰好落在他训练分布上(无意识或有意)。你的尺子必须自己造——这正是第 3 阶段第 1 课让你从第一个练习就攒样本的原因:到评审这天,评估集就是谈判桌上的筹码。
Q6:行业模型以后会不会被通用模型碾压? 有可能持续被侵蚀——通用模型能力提升会不断吃掉垂域优势(这正是查 8 要求对照基线的原因)。所以退出条款(查 11/12)格外重要:今天买的行业优势可能是暂时的,能干净退出比暂时领先更重要。
Q7:四问十二查要在什么阶段做? 书面初审(四问发函)放在技术评审前——筛掉明显不合格的,省双方时间;盲测放在入围后 2–3 家;试点(第 4 阶段第 4 课)放在签约前或作为合同一部分。顺序不能反:先试点后尽调,沉没成本会替供应商说话。
Q8:盲测样本发给供应商,会不会被他拿去训练,下次评测就失真了? 会,这是真实风险:测试集一旦进了对方训练数据,相当于他“背过答案”再进考场。三条防线:协议里书面约定测试数据仅用于本次评测、不进训练;样本分批发放,每轮只用一部分;永远留一批“压箱底”样本不给任何供应商——那是你验收和将来重选供应商时的最后一把尺子。
自测
你收到两家方案:A 开放权重自部署(含行业 LoRA,报价高);B 通用云 API + 自建制度检索(报价低)。写出你的评审提纲(至少六个待办动作)。
参考要点(先自己作答,再展开对照)
评审提纲(按流程排):
- 定任务与验收标准:业务指标(高风险召回/误报)、样本集 60 题(典型+边界+注入),两人独立标注(第 3 阶段第 1 课);
- 硬约束筛查:数据出域要求、信创要求、延迟上限——先淘汰硬伤方案;
- 书面初审(四问):A 查底座版本/LoRA 归属/数据授权/升级重训费用;B 查云服务数据条款(留权训练?出域范围?);
- 同题盲测:两家同批样本、同一评分口径,记质量 + p95 延迟 + 单次成本;
- 完全成本测算(第 3 阶段第 4 课):A 的硬件折旧 + 运维人力 + 许可合规 vs B 的 token 费 + 检索系统维护,加人工复核与风险成本;
- 退出条款:A 的 LoRA 产物与评估集归属、底座升级重训责任;B 的数据导出格式、换模型时评估集独立性;
- 小规模试点 + 停止条件(下一课):先跑低风险场景,红线触发即停。
答题要点:先标准后方案、硬约束先筛、盲测定生死、退出入合同、试点收尾——顺序即方法论。
概念卡片
| 名词 | 一句话定义 |
|---|---|
| 开放权重 / 开源 / 闭源 API | 三种不同的获取与授权形态,商务含义完全不同,禁混用 |
| 垂域模型 | 面向行业任务优化的模型/服务;含金量靠四问验证不靠名词 |
| 四问十二查 | 底座、数据、效果、退出——评审地图,缺一问都是埋雷 |
| 同题对照 | 行业模型 vs 通用基线+提示/检索的盲测——评审核心动作 |
| 知识更新机制 | 规范变化的跟进方式;必须有检索侧,重训追不上改版 |
| 退出条款 | 提示词、评估集、数据、微调产物的归属与迁移——进场时谈 |
| 自部署三前提 | 合规 → 能力 → 经济按顺序过筛,剩下的才轮到算账 |
延伸阅读
- 与第 0 阶段第 2 课(自研哪一层)、第 3 阶段第 1 课(盲测方法)、第 3 阶段第 4 课(完全成本)、第 4 阶段第 2 课(微调正当场景)交叉复习。
- 许可证与模型版本属动态信息,谈判时逐条核对当时文本,必要时咨询专业意见(本课核验日期:2026-09-17)。