IR$^3$:基于对比逆强化学习的可解释奖励劫持检测与缓解
人工智能
2026-02-24 v1 机器学习
摘要
从人类反馈强化学习(RLHF)可实现强大的LLM对齐,但可能引入奖励劫持——模型利用代理奖励中的虚假关联而非真正对齐。进一步地,RLHF期间内化的目标是透明的,这使得劫持行为难以检测或纠正。我们提出IR3(Interpretable Reward Reconstruction and Rectification),一个逆向工程、解释并精细修复驱动RLHF调优模型隐式目标的框架。我们提出对比逆强化学习(C-IRL),通过对比后对齐策略与基线策略的配对响应来重构隐式奖励函数,以解释RLHF期间的行为变化。随后,我们通过稀疏自编码器将重构的奖励分解为可解释特征,通过贡献分析识别劫持特征。最后,我们提出缓解策略——干净奖励优化、对抗性塑形、受限优化和特征引导蒸馏——针对问题特征进行干预,同时保留有益的对齐。实验在多个奖励模型配置上表明,IR3与真实奖励的相关性达到0.89,识别劫持特征的精度超过90%,显著减少劫持行为,同时在3%以内保持原始模型的能力。
引用
@article{arxiv.2602.19416,
title = {IR$^3$: Contrastive Inverse Reinforcement Learning for Interpretable Detection and Mitigation of Reward Hacking},
author = {Mohammad Beigi and Ming Jin and Junshan Zhang and Jiaxin Zhang and Qifan Wang and Lifu Huang},
journal= {arXiv preprint arXiv:2602.19416},
year = {2026}
}