前沿可扩展评估的局限性:LLM 作为裁判无法赢得两倍数据
机器学习
2026-01-07 v3 机器学习
摘要
高质量标注在机器学习生态系统的快速扩张中日益成为瓶颈。因此,规模可评估的方法备受关注,这些方法旨在避免高成本的标注。许多人希望利用强大的现有模型来代替高成本标签,以提供廉价的模型评估。不幸的是,这种使用模型作为裁判的方法会引入偏见,如自我偏好,可能扭曲模型比较。越来越多的去偏工具系列旨在通过使用少量高质量标签来去偏大量模型判断。在本文中,我们研究了此类去偏方法在原则上可以达到的程度。我们的主要结果表明,当裁判模型的准确性不超过所评估模型时,任何去偏方法都无法通过一半以上地减少对真实标签的要求。我们的结果揭示了在评估前沿新发布模型(可能优于裁判)时,LLM 作为裁判范式的严峻局限。通过实证评估,我们展示了实际中可实现的样本量节省甚至比理论限制更为有限。在此过程中,我们提供了关于模型评估去偏方法的新观察,并指出了未来工作的有前景的方向。
引用
@article{arxiv.2410.13341,
title = {Limits to scalable evaluation at the frontier: LLM as Judge won't beat twice the data},
author = {Florian E. Dorner and Vivian Y. Nastl and Moritz Hardt},
journal= {arXiv preprint arXiv:2410.13341},
year = {2026}
}
备注
ICLR 2025; 28 pages, 8 figures