用于少样本模型对齐的激活奖励模型
计算机视觉与模式识别
2025-07-03 v1 机器学习
摘要
将大语言模型(LLM)和大多模态模型(LMM)对齐以符合人类偏好是提升模型生成输出质量的核心挑战,尤其是应用于实际场景。常见方法是使用奖励建模来编码偏好,通过强化学习实现对齐。然而,传统奖励建模难以适用于新的偏好,因为其需要针对不同偏好训练独立的奖励模型,通常需要大规模偏好数据集。为此,我们引入激活奖励模型(Activation RMs)——一种新型的少样本奖励建模方法,通过激活引导技术利用最小监督信号构建高质量的对齐奖励信号,无需额外模型微调。激活奖励模型在标准奖励建模基准测试中,超过了包括LLM-as-a-judge的零样本学习、基于投票的评分和基于标记概率的评分等现有少样本奖励建模方法。此外,我们展示了激活奖励模型在缓解奖励黑客行为方面的有效性,凸显了其在安全关键应用中的实用性。为此,我们提出了PreferenceHack——一个新的少样本设置基准,首次测试奖励模型在配对偏好格式下的奖励黑客行为。最终我们证明,激活奖励模型在该基准上实现了最佳性能,甚至超越了GPT-4o。
引用
@article{arxiv.2507.01368,
title = {Activation Reward Models for Few-Shot Model Alignment},
author = {Tianning Chai and Chancharik Mitra and Brandon Huang and Gautam Rajendrakumar Gare and Zhiqiu Lin and Assaf Arbelle and Leonid Karlinsky and Rogerio Feris and Trevor Darrell and Deva Ramanan and Roei Herzig},
journal= {arXiv preprint arXiv:2507.01368},
year = {2025}
}