评估监控

AI 应用评估:从离线测试到线上可观察性

建立覆盖质量、成本、延迟和安全的评估体系,让模型更新变得可比较、可回滚。

先说结论

没有评估集的 AI 应用,很难判断一次提示词或模型升级究竟变好还是变坏。评估应从真实任务出发,同时观察答案质量、延迟、成本和风险。

QUICK CHECK

开始前,先完成这 4 项检查

01

从真实用户问题建立小型基准集。

02

为关键任务定义可解释评分规则。

03

区分自动评分与人工抽检。

04

记录模型、提示词和数据版本。

SECTION 01

离线评估解决可比较问题

固定测试集能帮助团队比较不同模型、提示词和检索策略。测试集应覆盖常见请求、边界条件与高风险样本,并定期根据线上问题更新。

SECTION 02

线上监控关注真实使用

线上环境需要观察失败率、用户反馈、响应时间、Token 消耗和异常输出。涉及隐私的数据应脱敏后再进入日志系统。

  • 任务成功率
  • P95 延迟
  • 单位请求成本
  • 人工接管率
FAQ

常见问题

可以只让另一个模型评分吗?

可以作为辅助,但重要任务仍需要规则校验和人工抽检。

测试集多久更新一次?

没有固定周期;出现新的失败类型或业务规则变化时就应更新。

继续建立完整知识体系

从相关专题继续深入学习

按模型、数据、工作流、评估和安全逐步扩展自己的 AI 工程方法。

查看全部专题 ↗