奖励模型能自我改进:基于奖励引导的对抗性失效模式发现以提升鲁棒性
计算与语言
2026-04-09 v2
摘要
奖励建模(RM)通过捕捉人类偏好来实现大语言模型(LLM)的对齐,日益广泛应用于模型微调、响应过滤和排序等任务。然而,由于人类偏好的内在复杂性以及可用数据集的覆盖范围有限,奖励模型在分布迁移或对抗性扰动下常常会失败。现有的发现此类失效模式的方法通常依赖对偏好分布或失效属性的先验知识,在实际场景中缺乏此类信息时难以实用。本文提出了一种可行且无需依赖偏好分布的 метод,用于通过奖励引导的受控解码发现奖励模型的失效模式。基于此,我们引入了 REFORM(Self-Improving Reward Modeling Framework,自我改进奖励建模框架),通过使奖励模型自身引导生成得分错误的响应来增强鲁棒性。这些对抗性示例随后用于增广训练数据并修补奖励模型的误对齐行为。我们在两个广泛使用的偏好数据集 Anthropic Helpful Harmless(HH)和 PKU Beavertails 上对 REFORM 进行评估,证明其在不牺牲奖励质量的前提下显著提升了鲁棒性。值得注意的是,REFORM 在直接评估和下游策略训练中均保持性能,并通过消除虚假相关性进一步提升了对齐质量。
引用
@article{arxiv.2507.06419,
title = {Reward Models Can Improve Themselves: Reward-Guided Adversarial Failure Mode Discovery for Robust Reward Modeling},
author = {Pankayaraj Pathmanathan and Furong Huang},
journal= {arXiv preprint arXiv:2507.06419},
year = {2026}
}