没有评估集的 AI 应用,很难判断一次提示词或模型升级究竟变好还是变坏。评估应从真实任务出发,同时观察答案质量、延迟、成本和风险。
QUICK CHECK
开始前,先完成这 4 项检查
01
从真实用户问题建立小型基准集。
02
为关键任务定义可解释评分规则。
03
区分自动评分与人工抽检。
04
记录模型、提示词和数据版本。
SECTION 01
离线评估解决可比较问题
固定测试集能帮助团队比较不同模型、提示词和检索策略。测试集应覆盖常见请求、边界条件与高风险样本,并定期根据线上问题更新。
SECTION 02
线上监控关注真实使用
线上环境需要观察失败率、用户反馈、响应时间、Token 消耗和异常输出。涉及隐私的数据应脱敏后再进入日志系统。
- 任务成功率
- P95 延迟
- 单位请求成本
- 人工接管率
FAQ
常见问题
可以只让另一个模型评分吗?+
可以作为辅助,但重要任务仍需要规则校验和人工抽检。
测试集多久更新一次?+
没有固定周期;出现新的失败类型或业务规则变化时就应更新。
继续建立完整知识体系
查看全部专题 ↗从相关专题继续深入学习
按模型、数据、工作流、评估和安全逐步扩展自己的 AI 工程方法。