Appearance
Q136 · 如何评估大语言模型的性能?有哪些评估指标?
团队要给客服助手换一个更强的大模型。新模型在公开选择题上分数更高,却把一条已过期的退货政策写进了回答,而且回复慢了一倍。此时说“新模型性能更好”显然太粗糙。先定义任务与成功标准,再用多种指标观察正确性、可靠性和使用代价,才是完整的评估。Stanford HELM 原论文强调跨场景、多维指标的评估;OpenAI 官方评估指南也从目标、数据集和指标定义开始。

图中三枚放大镜不是三个固定的“万能分数”,而是提醒你:模型在给定任务上答得对吗?这个答案有证据、可被信任吗?用户使用它要等多久、花多少资源? 每个维度还要细化成可计算、可复查的指标。
术语:先明确谁在考、怎么打分
| 名词 | 初学者可以这样理解 |
|---|---|
| 模型 | 根据输入预测输出的语言模型;它可能只回答文字,也可能给出工具调用建议。 |
| 系统 | 模型加上提示词、检索、工具、权限、缓存等组成的实际产品。同一个模型接不同系统,结果会不同。 |
| 测试集 / Eval set | 预先保存的一批输入和期望判断,用来比较版本;不能一边看结果一边改题又报原成绩。 |
| 样本 | 测试集中的一条任务,通常包含输入、相关背景、可接受结果与评分规则。 |
| 基准 / Benchmark | 社区共用的公开题集与评测方法,如 MMLU 或 GSM8K;便于研究比较,但覆盖不了每个业务。 |
| 指标 / Metric | 把观察结果变成数字的规则,如 100 题答对 84 题得 84% 准确率。 |
| 标注 / 人工评审 | 人按照统一规则判断答案;开放式回答经常需要它。 |
| LLM 裁判 | 用另一个模型按评分标准评审答案,速度较快,但可能有偏见,需要人工校准。 |
| Grounding / 有依据 | 答案中的事实能从给定文档、工具返回或可信来源找到支持。回答语气自信不等于有依据。 |
| 数据污染 | 测试题或答案曾进入训练、调参或提示开发过程,导致分数高估对陌生任务的能力。 |
| 置信区间 | 由于只测了一部分任务,真实表现可能落在一个范围内;区间帮助判断分数差异是否可靠。 |
| p95 延迟 | 100 次请求按耗时排序,约 95 次不超过的那个时间;关注少数用户等很久的情况。 |
下文使用一份虚构的客服测试集作例子:固定 100 条最近业务问题,包含退货、物流和发票;政策版本在测试集中写清楚。旧系统 78 条完全满足要求,新系统 84 条完全满足要求。这个 78% → 84% 是示范怎么算指标,不是某个实际模型的成绩。
第一步:写出任务和“成功”长什么样
如果用户问“签收八天后还能退吗”,只核对“是否出现‘七天’两个字”不够。团队需要规定:先查适用政策版本,再判断签收日期与当前日期差,解释理由,不编造例外;若缺少签收日期,就要求补充。一个回答的语言流畅,不等于业务动作正确。
对这 100 条题,可以设一个主指标:整单成功率。每条题只有在政策正确、日期计算正确、必要信息完整、没有越权承诺时才算成功。旧版 78/100 = 78%;新版 84/100 = 84%。再分解错误:新版 16 条失败里,假设 5 条引用旧政策、4 条算错日期、3 条漏问缺失信息、4 条答非所问。这样才能知道下一步应修检索、算术、提示或数据。
评估目标若是基础模型的一般知识能力,可以使用公开基准;若目标是上线客服系统,则必须评估完整系统和真实业务分布。MMLU 测多学科选择题,GSM8K 测小学数学文字题,两者都是有用的能力切片,但无法直接给出“能否准确遵守我公司的最新退货政策”。MMLU 原论文 · GSM8K 原论文
第二步:给不同任务选合适的正确性指标
选择题准确率最直观:正确选项数 ÷ 总题数。MMLU 常用这类指标。必须同时记录题集版本、提示示例数、是否允许模型展开推理、答案提取方式;不同协议下的两个百分比不能直接排序。若有四个选项,随机猜的期望正确率约 25%,但实际题目可能有选项偏差,不能把这当成所有设置的严格下界。MMLU 原论文
**精确匹配(Exact Match)**要求最终答案与标准答案一致。数学题的数字答案、结构化字段较适合。例如标准为 450,回答 450 算对;若回答格式多写了单位,评分器必须先按预定规则抽取答案,不能让两模型使用不同抽取器。精确匹配能避免把“看起来差不多”的错误答案算对,但对多种都合理的开放式表达太苛刻。
步骤或字段正确率适合定位问题。客服回答可以分别检查“政策版本正确”“退款资格判断正确”“日期计算正确”“答复格式完整”。这些辅助指标不能偷偷替代整单成功率:如果四项各有 90%,并不代表每一单都能成功。对代码任务,可把生成代码放进隔离环境跑测试,统计测试通过率;同时注意测试覆盖的局限。
人工评分与模型裁判适合摘要、解释、写作等没有唯一字符串答案的任务。先给标注员明确规则,如“事实正确 0–2 分、覆盖关键点 0–2 分、语气与格式 0–1 分”,再抽样多人交叉标注。模型裁判可以加速,但要用人工黄金样本检验它是否偏爱长答案、某种格式或自己的输出;重要错误要回看原始输入和证据。OpenAI 的评估指南描述了盲评、模型裁判与指标设计的使用边界。OpenAI 评估最佳实践
困惑度(Perplexity)或预测损失衡量模型给文本分配概率的能力,常用于语言建模研究。数字越低通常表示在那批文本上的预测越好,但它高度依赖分词方式与数据集,也不直接等于“客服问题解决率”。不能拿不同分词器、不同文本集合的困惑度硬比产品质量。
第三步:正确之外,还要量什么
**事实与依据。**检索增强问答要看引用的政策是否真的支持结论、版本是否适用。可以统计“有证据支持的陈述比例”“引用正确率”“无证据时能否拒答”。例如新模型 84 条整单成功,却有 5 条引用旧政策的失败,若这些错误涉及退款承诺,产品风险比一般格式错误高。不要只计“答案里出现了链接”;链接指向无关页面也不算有依据。
**稳健性。**把同一需求改写成口语、错别字、长上下文、字段顺序变化后复测,看看成功率是否大幅下降;还要测缺失字段、工具超时、相互矛盾的文档。HELM 把稳健性与准确率分开衡量,原因是单一干净题集不能说明复杂环境中的表现。HELM 原论文
安全与合规。例如越权提交退款、泄露另一位用户订单、执行提示注入内容,都是必须单独统计的失败。高风险场景可设硬门槛:“未授权退款执行数为 0”。即使总体准确率提高,也不能用平均分抵消严重安全失败。具体政策需按产品和法律环境制定,此处强调的是评测设计。
**效率与成本。**记录首字出现时间、整段完成时间、p50/p95 延迟、输入输出 token、工具调用次数、每成功任务成本。假设新系统整单成功率由 78% 升到 84%,但 p95 从 4 秒变成 12 秒,而且每单费用翻倍,是否上线要根据业务可接受的等待与预算判断。测量时固定硬件、流量、并发、提示长度等条件,否则“模型慢”可能是环境不同。
**校准与不确定性。**若系统有可解释的置信信号,还可看“说自己很确定时,是否真的更常正确”。语言上的“我非常确定”不能当作可靠概率。要让模型能在证据不足时说“不确定”,并检查这种拒答是否恰当,而不是只奖励永远给出答案。HELM 把校准列为独立维度。HELM 原论文
第四步:让两次评估真正可比
固定题集与评测协议:模型版本、系统提示、工具、知识库快照、温度或采样配置、输出长度限制、答案抽取器、人工评分细则都要记录。若只换了模型,其他条件尽量保持一致;若比较的是两个完整方案,则应明确“方案 A/B”而不是把系统差异误说成纯模型差异。
把题集分层:公开基准看通用能力,未参与开发的业务保留集看真实问题,专项对抗集看越权、缺数据、错误文档;按问题类型报告分数和样本量。若 100 条样本里新版多答对 6 条,不应立刻宣称稳定提升 6 个百分点:样本较小,任务分布也可能偏。可做配对比较——同一批题给两个版本——并用置信区间、人工复核和更多样本判断差异。报告至少写“84/100”,不要只写“84%”掩盖样本规模。
还要防止看题调参后仍把原题当最终考试。如果团队反复针对那 100 条修改提示,最终分数会越来越像记住了测试集。应留一份未看过的最终测试集;已用于调试的错误题可以保留在回归集,但它回答的是“老问题有没有修复”,不是新问题泛化能力。OpenAI 评估最佳实践
离线通过后,先在小流量或影子流量验证:看真实用户的任务完成、转人工、投诉、延迟和成本;对高风险输出设置人工审核与回滚条件。线上 A/B 测试还要考虑随机分流、用户重复访问和业务波动,不能把上线第一天的偶然结果当定论。
一次容易误判的评测结果
设新模型 MMLU 分数较高、100 条客服题整单成功也从 78 条升到 84 条。团队准备上线时,分层报告发现“过期政策问题”旧版错 1/10、新版错 5/10。若直接看总成功率,新版似乎更强;但这十道题是必须守住的关键场景。下一步应检查检索是否返回了旧文档、模型是否忽视生效日期、评分规则是否把错误引用判成正确。修复后用新的保留题和真实流量再验证,不能为了“总体 84%”跳过这个失败。
这个例子说明:平均分是入口,错误类别和业务后果决定动作。 指标越多也不能乱挑对自己有利的结果;上线前应预先指定主指标、护栏指标与最低可接受门槛。
面试时怎么回答
评估大语言模型,我先明确评估对象是基础模型还是完整应用,以及它要完成什么任务。通用能力可以用 MMLU、GSM8K 等固定基准,选择题看准确率、数学最终答案看精确匹配;业务任务要建自己的未泄漏测试集,按整单成功率和错误类型评。开放式生成可用人工盲评或经过人工校准的模型裁判,同时检查事实依据、稳健性、安全、校准、p95 延迟和每成功任务成本。比较两版时固定题集、提示、工具和评分协议,报告样本数与不确定性;再用小流量线上验证。一个公开榜单分数或一句“回答更流畅”,都不足以证明实际产品更好。
若追问“准确率提升就能上线吗”,回答:看是否触犯安全护栏、某些关键场景是否退步,以及延迟成本是否可接受。若追问“模型裁判可否替代人工”,回答:可辅助扩大覆盖,但先用人工标注校准,并抽查分歧与偏差。
资料依据
- Stanford HELM:Holistic Evaluation of Language Models:多场景、多指标评估。
- OpenAI:Evaluation Best Practices:目标、数据集、评分规则和模型裁判。
- MMLU 原论文:多学科选择题基准。
- GSM8K 原论文:数学文字题基准。