Skip to content
阅读进度0%
知识库待复核

评估指标

RAG、生成、Agent、训练和生产监控常用指标速查。

评估指标

指标不是越多越好。先选能解释业务失败的指标,再补自动化评估。每个指标都要配样本,否则只是漂亮数字。

RAG 指标

指标看什么适用场景
Recall@k正确证据是否进入前 k 个检索结果调 chunk、embedding、召回策略
MRR / NDCG正确证据排得是否靠前比较 rerank、混合检索
Context Precision放进上下文的内容是否大多相关控制上下文污染
Faithfulness答案是否被上下文支持检查幻觉与引用可靠性
Citation Accuracy引用是否对应答案中的关键断言企业知识库、合规场景

相关阅读:RAG 评估

生成质量指标

指标看什么注意事项
Exact Match输出是否与标准答案完全一致适合短答案,不适合开放问答
F1 / Rouge文本重叠程度容易奖励“像答案”而非“对答案”
JSON/schema pass rate是否符合结构化输出约束适合信息抽取、自动化管道
Human preference人类更偏好哪个输出要控制评审标准和样本顺序
Refusal quality该拒答时是否拒答且解释充分安全、医疗/法律等高风险场景

相关阅读:Prompt 安全测试

Agent 指标

指标看什么适用场景
Task Success Rate任务是否完成且结果可用端到端 Agent 评估
Tool Call Accuracy工具选择和参数是否正确函数调用、MCP 工具
Recovery Rate工具失败后能否重试或降级生产工作流
Human Intervention Rate需要人工接管的比例半自动系统、审批流
Cost / Latency per Task单任务成本和耗时预算控制、体验优化

相关阅读:Agent 评估与监控

训练与微调指标

指标看什么适用场景
Validation Loss模型在验证集上的拟合情况训练过程监控
Win Rate新模型相对基线被偏好的比例SFT/DPO 后对比
Regression Rate旧能力退化比例发布前回归
Safety Pass Rate安全/合规样本通过率对齐和上线评估
Calibration置信度与正确率是否匹配风险决策、拒答策略

相关阅读:训练评估

生产监控指标

  • 延迟:P50/P95/P99,按模型、工具、检索阶段拆分。
  • 成本:输入/输出 token、检索成本、工具调用成本。
  • 错误率:模型错误、工具错误、解析错误、超时。
  • 安全:越权请求、提示注入、敏感数据命中。
  • 用户反馈:点赞/点踩、人工修正、重复问题。

指标选择原则

  1. 先定义失败样本,再定义指标。
  2. 自动指标只能做筛查,关键发布仍要人工抽检。
  3. 每次改模型、提示、检索或工具,都用同一评估集对比。
  4. 把线上失败样本回流,指标才会越来越贴近真实风险。

基于 VitePress 构建