语义之外的实时对齐奖励模型
人工智能
2026-05-19 v4
摘要
从人类反馈中进行强化学习(RLHF)是大型语言模型(LLM)与人类偏好对齐的关键技术,但易受奖励过优化的影响,即策略模型对奖励模型过拟合,利用虚假的奖励模式而非忠实地捕捉人类意图。先前的缓解措施主要依赖表面语义信息,难以有效解决奖励模型与策略模型之间因持续策略分布迁移导致的对齐问题。这不可避免地导致奖励差距不断扩大,加剧奖励过优化。为解决这些限制,我们引入R2M(Real-Time Aligned Reward Model),一种新的轻量级RLHF框架。R2M超越仅依赖预训练LLM语义表示的常规奖励模型,利用策略模型(即策略反馈)的演化隐藏状态来与策略在RL过程中持续的分布迁移保持对齐。本工作指向通过实时利用策略模型反馈来提高奖励模型性能的前景方向。
关键词
引用
@article{arxiv.2601.22664,
title = {Real-Time Aligned Reward Model beyond Semantics},
author = {Zixuan Huang and Xin Xia and Yuxi Ren and Jianbin Zheng and Xuefeng Xiao and Hongyan Xie and Li Huaqiu and Songshi Liang and Zhongxiang Dai and Fuzhen Zhuang and Jianxin Li and Yikun Ban and Deqing Wang},
journal= {arXiv preprint arXiv:2601.22664},
year = {2026}
}