BenchMIRT:用项目反应理论拆解大模型评测基准的真实信号

行业分析BenchMIRTopenstarry.com

为什么需要看"题目级别"的信号

一个常见的假设是:一个名字叫"安全"的基准,分数就代表模型安全能力;一个名字叫"推理"的基准,分数就代表模型推理能力。但实际数据往往更复杂。

例如 BBQ 这类被归入安全类的社会偏见基准,其中一道关于祖孙预约网约车的题目,既在探测年龄偏见,也要求模型理解人物关系并基于证据推理;WildJailbreak 同时混入"有害越狱提示"和"良性提示"两类题目,前者更贴近安全,后者更贴近通用推理。直接把这些题目取平均,会掩盖不同信号之间的差异。

对于真正在意"模型在某项能力上到底处于什么水平"的团队而言,这种信号混淆会带来误判:分数低的模型,可能并不是这项能力不行,而是被题目里混入的其他要求拉低了表现。

BenchMIRT 是什么:基于多维项目反应理论的评测审计方法

BenchMIRT 的核心思路来自心理测量学中的项目反应理论(Item Response Theory, IRT)。IRT 的基本假设是:不同题目对被试者的区分力不一样,有些更难,有些更能分辨强弱的差距。

BenchMIRT 将这一思路扩展到多维(Multidimensional IRT,即 MIRT),允许同一道题同时受多种能力影响。在模型层面,它估计每个模型在不同能力维度上的强弱;在题目层面,它估计每道题的难度,以及它对不同能力维度上强弱模型的区分力。

训练数据来自 100 个大语言模型在 16 个基准、超过 3.4 万道题目上的评测结果。其中 6 个基准衡量通用推理(如 MMLU-Pro、GPQA、MATH、BBH 等),另外 10 个来自一个安全评测套件,涵盖 HarmBench、StrongReject、WildJailbreak、BBQ、WMDP、XSTest 等。值得注意的是,研究者在训练时并没有告诉 BenchMIRT 哪些基准测什么能力,但模型自行稳定地恢复出两个主导维度——安全与通用推理,多次重复分析都能得到相同结论。

它揭示了什么:基准分数背后的能力混淆

BenchMIRT 的分析对很多基准的"自称方向"给出了确认:推理类基准的得分与推理能力相关,越狱与有害内容类基准的得分与安全能力相关。

但它也揭示出更复杂的画面:

这些发现并不意味着相关基准本身有问题,而是提醒使用者:一个总分常常是多种信号的加权混合,需要在解读时区分。

用更少的题目做更高效的评测

BenchMIRT 还能识别每道题的信息量,从而压缩评测规模。

对评测预算紧张的团队来说,这意味着可以用更小的题目集合得到接近全量的判别力,对老模型的回顾性分析尤其有用。

如何用起来

BenchMIRT 的代码以开源形式发布,使用者可以根据自己的评测数据进行复用与定制。

基本流程为:准备模型在多个基准上的逐题作答记录 → 用脚本完成模型与题目维度的能力估计 → 查看每个基准与各能力维度的相关性图,识别被混淆的信号 → 按信息量排序题目,挑出最具备区分力的子集用于精简评测。

局限与适用建议

BenchMIRT 也有明确的边界,使用时应结合自身需求判断。

选型建议如下:

  1. 当你需要理解"为什么这个基准的分数是这样"——例如排查模型在安全套件中某一项异常时,优先用 BenchMIRT 做信号分解。
  2. 当你需要做大规模回归式评测、预算有限——可以用其题目排序能力压缩评测集,但应保留与全量基准的对照数据,用于周期性校验压缩后集合的有效性。
  3. 当你的目标就是给出一个总榜排名——直接使用基准平均分更简单,且当前略优于 BenchMIRT。
  4. 在使用前,建议先确认所用模型的发布时间晚于 2025 年 3 月的程度,必要时用一部分新模型做能力维度稳定性验证。

总体而言,BenchMIRT 适合作为评测体系的"诊断工具"而非替代品:先用它看清每个基准在测什么,再决定是否、如何简化或重组评测流程。

以 AI 之力,筑未来之境

现在注册,立即免费获赠 200 次大模型调用权益

免费注册 →