引言为什么需要一把尺子
AI 项目最常见的死法不是技术不行,而是没人能说清它到底带来了什么。
上线三个月,老板问「省了多少钱」:业务说「效率提升明显」,财务说「账上没看出来」,
IT 说「调用量涨了 5 倍」。三个人答的是三件事,没有一件能签字。
典型的伪验收:「响应速度提升 40%」(跟什么比?)·「准确率 95%」(拿哪批题考的?谁出的题?)·
「大幅节省人力」(几个人?他们现在做什么?)·「用户反馈良好」(几个用户?问了什么?)
本标准就是那把尺子:一套术语、五条规则、一页纸模板,签下去就能用。
1范围
本标准适用于以「替代或辅助人工完成既有业务流程」为目标的企业 AI 项目验收——
不限行业、不限模型、不限供应商,自建团队同样适用。
本标准不评价模型技术指标,只回答一个问题:这个项目到底带来了什么,数字能不能签字。
2术语与定义
2.1人工基线
AI 上线前,这条流程用人工完成的实测成本。由四个数构成:单件耗时、单件人力成本、月处理量、返工率。
2.2黄金集
由甲方业务专家标注的一批标准答案,用来给系统质量打分。建议 200–500 条,覆盖疑难长尾。归甲方所有,版本化管理。
2.3验收线
开工前双方写死的质量下限,表述为黄金集得分阈值(例:得分 ≥ 95%)。写定后任何一方不得单方修改。
2.4AI 全成本
模型调用费+平台/许可费+运维人力摊销。三项都算,少一项即为漏项。
2.5效益
单件人力成本 × AI 实际处理量 − AI 全成本。实际处理量取自系统流水,不取估计值;未达验收线的期间不计入。
3规则(五条)
第 3.1 条
先量人工基线,再碰 AI
系统上线之前,把这条流程现在的成本实测出来(按 2.1 的四个数)。
没有这个锚点,之后所有的「提升」都是浮的。
基线必须在动手之前测——事后回忆出来的基线,总会往对回忆者有利的方向偏。
第 3.2 条
基线双方签字,写明谁签的、哪天签的
供应商单方面报的不算数,甲方单方面定的也不算数。
签字不是形式,是把「后来不认这个数」这条路堵死。
留档三要素:签署人、日期、口径说明。
第 3.3 条
质量用黄金集打分,不用形容词
质量 = 系统在黄金集(2.2)上的得分。一个数,没有形容词。
供应商可以看题、可以调优,但不能改答案。
第 3.4 条
先定验收线,再看结果
验收线(2.3)在开工前写死。先看结果再画线,等于没有线。
达不到就是达不到:整改到达标,或者终止,唯独不能改线。
第 3.5 条
效益 = 人工基线 × 实际处理量 − AI 全成本
三个变量各有出处。基线来自签字文件(3.2),处理量来自系统流水,全成本按 2.4 三项算齐——
不能只算模型调用费。
未达验收线的工作流,其数字不计入效益——这一条最容易被绕过,也最重要。
4一页纸模板
照着填即可,不需要任何工具。哪一栏空着填不出来,哪里就是项目的风险所在。
【验收基线确认书】
工作流名称:____________________
适用范围:____________________(哪些场景算,哪些不算)
一、人工基线(AI 上线前实测)
单件耗时:______ 分钟 测量方式:____________________
单件人力成本:______ 元 口径:______ 年薪 ÷ ______ 有效工时
月处理量:______ 件 数据来源:____________________
当前返工/差错率:______ %
二、质量标准
黄金集条数:______ 标注人:____________________
黄金集版本:______ 存放位置:____________________
验收线:得分 ≥ ______ %(本行在开工前填写,此后不得修改)
三、效益口径
效益 = 单件人力成本 × AI 实际处理量 − AI 全成本
AI 全成本包含:□ 模型调用费 □ 平台/许可费 □ 运维人力摊销
未达验收线的期间:□ 不计入效益
四、签署
甲方:____________ 职务:__________ 日期:__________
乙方:____________ 职务:__________ 日期:__________
5常见规避方式(提前认出来)
- 基线虚高——人工成本按最资深的人算,或把别的流程的工时也算进来。
- 黄金集偷换——供应商「帮忙优化」了标注,答案往系统擅长的方向偏。
- 范围漂移——上线后把难处理的案子悄悄划出「适用范围」,得分自然上去。
- 成本漏项——只算模型调用费,平台费和运维人力当不存在。
- 时间窗挑选——只报表现最好的那两周。
附则许可与版本
使用许可:本标准公开发布。
任何人可以自由使用、复制、修改、用于商业项目——无需署名,无需告知我们。
拿去和别的供应商谈判也完全可以:它帮你避免一个糊涂项目,目的就达到了。
为什么我们愿意公开:我们做的生意是把账算清楚。
行业里认真算账的人越多,我们越好做;只会讲故事的人越多,所有人都难做。
v1.0 · 2026-07 发布。改进建议写到 [email protected],下一版注明来源。