模型输出具有波动性,演示样本也容易被有意或无意地挑选。一个小而稳定的基线,可以把讨论从“这次看起来不错”推进到“在哪些任务上改善,代价是什么”。
一、样本覆盖真实任务与失败风险
样本不必一开始很多,但要覆盖常见输入、边界输入、信息缺失、冲突信息和高风险操作。每个样本写清期望行为,以及哪些错误绝不能接受。
二、评分规则先于模型输出
在查看新模型结果前确定评分维度,例如事实正确、格式遵循、引用支持、拒答合理和延迟成本。先看结果再改规则,会把主观偏好包装成评测。
三、固定运行条件
记录模型版本、提示版本、生成参数、工具与知识库版本。比较时一次只改变关键变量,否则无法说明提升来自模型、提示、检索还是样本偶然性。
四、错误分类比平均分更有用
平均分可能掩盖严重错误。把失败分为事实、指令、格式、引用、权限和拒答等类别,可以看到改动是否用一种错误换来了另一种错误。
五、把上线标准写成决策门槛
- 关键错误不得高于当前基线。
- 改善应在重复运行中保持,而非只出现一次。
- 成本和延迟增加必须有对应收益。
- 高风险任务保留人工确认和回滚路径。
参考来源
- Liang 等:Holistic Evaluation of Language Models,访问于 2026-07-29。
- NIST AI Risk Management Framework,访问于 2026-07-29。