优秀模型彼此相似会削弱AI监督
机器学习
2025-06-13 v2 人工智能
计算与语言
摘要
随着语言模型(LM)能力的提升,人类对其进行规模化评估和监督变得愈发困难。希望通过其他语言模型来自动化这两项任务,这我们称之为"AI监督"。我们通过提出 Chance Adjusted Probabilistic Agreement (CAPA):一种基于模型错误重叠度的LM相似性度量标准,研究模型相似性如何影响这两个AI监督方面。使用CAPA,我们首先表明,LLM评判得分偏好与评判模型相似的模型,概括了近期的自我偏好结果。随后,我们研究在LM注释上进行训练,发现弱监督者与强学生模型之间的互补知识是"弱到强"泛化获益的关键因素。随着模型能力的提升,寻找其错误变得更加困难,我们可能会更多地依赖AI监督。然而,我们观察到一种令人担忧的趋势——随着能力的提升,模型错误变得越来越相似,这指向了来自相关失效的风险。我们的工作强调,在新兴的AI监督范式中,报告和纠正模型相似性的重要性,尤其是对于确保AI系统可靠性具有关键意义。
引用
@article{arxiv.2502.04313,
title = {Great Models Think Alike and this Undermines AI Oversight},
author = {Shashwat Goel and Joschka Struber and Ilze Amanda Auzina and Karuna K Chandra and Ponnurangam Kumaraguru and Douwe Kiela and Ameya Prabhu and Matthias Bethge and Jonas Geiping},
journal= {arXiv preprint arXiv:2502.04313},
year = {2025}
}
备注
60 pages, 20 figures