Skip to content

45. 你会如何评估一个 RAG 或 Agent 系统的效果? ​

难度 P1 高频 · 岗位 应用 · 频率 ★★★ · 预计阅读 5 min

本题阅读地图 ​

  1. 💡 简要回答
  2. 📝 详细解析
  3. 🎯 面试总结

👔面试官:你会如何评估一个 RAG 或 Agent 系统的效果?

🙋‍♂️我:看准确率,回答对不对。

👔面试官:太单一。要分离线评测和在线评测,RAG 分检索层和生成层,Agent 分轨迹级和结果级。评测不能只给总分,要能定位问题层级。你能系统讲吗?

💡 简要回答 ​

分层评测:

类型层级指标
RAG 离线检索层相关内容召回率、引用片段准确率
RAG 离线生成层答案忠实度、引用正确率、拒答合理性
Agent 离线轨迹级工具选择准确率、参数正确性、循环次数
Agent 离线结果级任务完成率、输出质量
在线评测用户侧满意度、转人工率、中断率、耗时

评测闭环:分层建指标 → 沉淀 badcase → 驱动迭代。

📝 详细解析 ​

RAG 离线评测 ​

检索层:

  • 相关内容有没有被召回?
  • 引用片段对不对?
  • Badcase 卡在切块、召回、重排还是过滤?

生成层:

  • 答案是否忠实于证据?
  • 引用是否正确?
  • 无依据时能否拒答?
  • 对业务是否有帮助?

Agent 离线评测 ​

轨迹级:

  • 有没有选对工具?
  • 参数对不对?
  • 有没有无效循环?
  • 是不是过早结束?

结果级:

  • 最终任务有没有完成?
  • 输出质量是否达标?

在线评测 ​

  • 用户满意度
  • 转人工率
  • 任务中断率
  • 耗时分布
  • 工具调用成功率
  • 人工兜底比例

评测方法 ​

规则评测:精确匹配、正则检查。

LLM-as-a-judge:用模型评判,需校准。

人工抽检:高风险场景兜底。

评测闭环 ​

  1. 分层建指标
  2. 沉淀 badcase
  3. 定位问题层级(切块?召回?生成?工具?)
  4. 驱动 Prompt、检索、工具、流程迭代

🎯 面试总结 ​

分层评测,定位问题。不只是"分数高低",是"问题出在哪层"。


章节首页 · ← Q44 · Q46 →

最后更新2026-05-01
难度P1
频率medium
阅读5 min
主题rag / agent
觉得有帮助?把这个链接转给正在求职的朋友 · 用 Ctrl + K 全站搜索其它题