中文

评分者应当作弊:特权信息使自动化评估达到专家级水平

机器学习 2025-02-18 v1 人工智能

摘要

自动评估语言模型(LMs),即使用评分者 LM 来评估候选 LM,是加速评估过程及其相关成本的有吸引力的方法。但这呈现了一个悖论:如何信任一个可能弱于候选 LM 的评分者 LM,来评估超出任一模型或两者能力前沿的问题?例如,当前的 LMs 在研究生级别的物理和奥林匹克级别的数学上表现挣扎,使它们在这些领域成为不可靠的评分者。我们表明提供特权信息——如真实解或问题特定指南——能改善此类前沿问题上的自动化评估。该方法有两个关键优势。第一,它扩大了 LM 评分者适用的问题范围。具体而言,较弱的模型现在可以评估较强模型的预测。第二,特权信息可用于设计具有挑战性问题的更简单变体,从而改善不同 LMs 在其整体表现较低的任务上的区分度。采用此方法,通用 LM 评分者在 RewardBench 上达到了最先进性能,超越了几乎所有专门调优的模型。LM 评分者在 Vibe-Eval 上也超越了单独的人类评分者,并在奥林匹克级别的数学问题上接近人类专家评分者。

关键词

引用

@article{arxiv.2502.10961,
  title  = {Graders should cheat: privileged information enables expert-level automated evaluations},
  author = {Jin Peng Zhou and Sébastien M. R. Arnold and Nan Ding and Kilian Q. Weinberger and Nan Hua and Fei Sha},
  journal= {arXiv preprint arXiv:2502.10961},
  year   = {2025}
}