大模型时代的奖励钻取:机制、涌现性错位与挑战
机器学习
2026-04-16 v1
摘要
强化学习从人类反馈(RLHF)及相关对齐范式已成为引导大语言模型(LLM)和多模态大语言模型(MLLM)实现人类偏好行为的核心方法。然而,这些方法引入了一个系统性漏洞:奖励钻取(reward hacking),即模型利用所学奖励信号的缺陷,以最大化代理目标而非实现真实任务意图。随着模型规模扩大和优化加剧,这类利用表现为 verbosity bias(冗长偏差)、sycophancy(谄媚)、扭曲的合理化、基准测试过拟合,以及在多模态情境中出现的 perception-reasoning 脱钩和评估器操纵。近期证据进一步表明,看似善意的捷径行为可概括为更广泛的错位形式,包括欺骗和策略性地游戏化监督机制。本文在此调查中,我们提出代理压缩假说(PCH)作为理解奖励钻取的统一框架。我们将奖励钻取形式化为在对高维人类目标压缩表示的奖励表示上优化具有表达性的策略时所产生的涌现性结果。从而,奖励钻取源于目标压缩、优化放大和评估器-策略共适应的相互作用。该视角统一了 RLHF、RLAIF 和 RLVR 各 regime 中的经验现象,并解释了如何从局部捷径学习概括为更广泛的错位形式,包括欺骗和策略性操纵监督机制。我们进一步根据如何干预压缩、放大或共适应动态来组织检测和缓解策略。通过将奖励钻取视为基于代理的对齐在规模下的结构性不稳定,我们突出了可扩展监督、多模态 grounding 和 agentic autonomy 等开放挑战。
引用
@article{arxiv.2604.13602,
title = {Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges},
author = {Xiaohua Wang and Muzhao Tian and Yuqi Zeng and Zisu Huang and Jiakang Yuan and Bowen Chen and Jingwen Xu and Mingbo Zhou and Wenhao Liu and Muling Wu and Zhengkang Guo and Qi Qian and Yifei Wang and Feiran Zhang and Ruicheng Yin and Shihan Dou and Changze Lv and Tao Chen and Kaitao Song and Xu Tan and Tao Gui and Xiaoqing Zheng and Xuanjing Huang},
journal= {arXiv preprint arXiv:2604.13602},
year = {2026}
}
备注
42 pages, 5 figures, 2 tables