自动发现奖励模型偏差
机器学习
2026-02-18 v1 人工智能
摘要
奖励模型是大型语言模型(LLM)后训练中的核心组件。然而,过去的研究表明,它们可能奖励虚构的或不可接受的属性,如长度、格式、幻觉和顺从。本文引入并研究了自动发现自然语言中奖励模型偏差的研究问题。我们提供一种简单方法,即使用 LLM 不断提议并优化候选偏差。我们的方法能够恢复已知偏差并揭示新偏差:例如,我们发现名为 Skywork-V2-8B 的领先开源奖励模型常常错误地偏好冗余空格和幻觉内容的回复。此外,我们展示了进化式迭代优于平坦的最佳-N 搜索,且我们通过人工注入偏差验证了管道的召回率。我们希望我们的工作促进通过自动可解释性方法改进奖励模型的进一步研究。
引用
@article{arxiv.2602.15222,
title = {Automatically Finding Reward Model Biases},
author = {Atticus Wang and Iván Arcuschin and Arthur Conmy},
journal= {arXiv preprint arXiv:2602.15222},
year = {2026}
}