AI 应用为什么需要新评测范式
给传统软件写测试用例,输入确定、输出可预期;而 AI 应用的输出具有概率性——同一个问题,模型两次回答可能不同。这让「测试」变得困难:无法用断言判断对错,回归测试失去意义。但生产级 AI 应用又必须回答三个问题:这次升级效果是变好还是变差?这个场景的模型能不能上线?线上质量如何持续监控?答案都指向同一个基础设施:评测体系。
评测体系的三层结构
- 评测集建设:每个业务场景建立专属评测集,包含三类样本:真实用户问题(从线上日志采集)、边界与对抗样本(敏感问题、诱导问题、模糊问题)、黄金标准答案(由业务专家标注)。评测集规模不必贪大,质量与覆盖度优先,300-500 条精心设计的样本往往优于 5,000 条粗糙样本。
- 自动化评测:客观维度(回答是否包含关键信息、引用是否真实存在、格式是否符合要求)用规则与程序自动判定;主观质量(流畅度、有用性)可借助强模型作为「评测员」打分,但需定期用人工标注校准评测员的一致性。
- 发布门禁与线上监控:模型或提示词变更必须通过评测门禁方可发布;上线后持续采样线上回答进行质量抽检,建立质量趋势看板。效果下滑能第一时间发现并回滚,是 AI 应用运营的底线能力。
组织建议
评测集建设不能只靠算法工程师——业务专家标注的黄金答案决定评测的「标尺」是否正确。建议为每个核心 AI 场景配备「业务评测合伙人」,把评测工作融入日常业务评审。AI 应用的质量不是测出来的,而是「评」出来的——没有评测体系的项目,迭代越快,翻车越快。