Appearance
45. 你会如何评估一个 RAG 或 Agent 系统的效果?
难度 P1 高频 · 岗位 应用 · 频率 ★★★ · 预计阅读 5 min
本题阅读地图
- 💡 简要回答
- 📝 详细解析
- 🎯 面试总结
👔面试官:你会如何评估一个 RAG 或 Agent 系统的效果?
🙋♂️我:看准确率,回答对不对。
👔面试官:太单一。要分离线评测和在线评测,RAG 分检索层和生成层,Agent 分轨迹级和结果级。评测不能只给总分,要能定位问题层级。你能系统讲吗?
💡 简要回答
分层评测:
| 类型 | 层级 | 指标 |
|---|---|---|
| RAG 离线 | 检索层 | 相关内容召回率、引用片段准确率 |
| RAG 离线 | 生成层 | 答案忠实度、引用正确率、拒答合理性 |
| Agent 离线 | 轨迹级 | 工具选择准确率、参数正确性、循环次数 |
| Agent 离线 | 结果级 | 任务完成率、输出质量 |
| 在线评测 | 用户侧 | 满意度、转人工率、中断率、耗时 |
评测闭环:分层建指标 → 沉淀 badcase → 驱动迭代。
📝 详细解析
RAG 离线评测
检索层:
- 相关内容有没有被召回?
- 引用片段对不对?
- Badcase 卡在切块、召回、重排还是过滤?
生成层:
- 答案是否忠实于证据?
- 引用是否正确?
- 无依据时能否拒答?
- 对业务是否有帮助?
Agent 离线评测
轨迹级:
- 有没有选对工具?
- 参数对不对?
- 有没有无效循环?
- 是不是过早结束?
结果级:
- 最终任务有没有完成?
- 输出质量是否达标?
在线评测
- 用户满意度
- 转人工率
- 任务中断率
- 耗时分布
- 工具调用成功率
- 人工兜底比例
评测方法
规则评测:精确匹配、正则检查。
LLM-as-a-judge:用模型评判,需校准。
人工抽检:高风险场景兜底。
评测闭环
- 分层建指标
- 沉淀 badcase
- 定位问题层级(切块?召回?生成?工具?)
- 驱动 Prompt、检索、工具、流程迭代
🎯 面试总结
分层评测,定位问题。不只是"分数高低",是"问题出在哪层"。