面向通用 RLHF 的信息论奖励分解
人工智能
2025-10-27 v2 计算与语言
机器学习
摘要
通用奖励模型对于强化学习从人类反馈(RLHF)至关重要,因为它能够正确评估未看到的提示-响应对。然而,现有的奖励模型缺乏这种能力,因为它们通常通过增加所选响应与被拒绝响应之间的奖励差来训练,忽略了响应所依赖的提示。因此,当训练好的奖励模型在数据分布之外的提示-响应对上进行评估时,忽略提示的影响可能导致奖励模型表现不佳。为此,我们将奖励值分解为两个独立组成部分:无提示奖励和提示相关奖励。无提示奖励代表仅由响应决定的评估,而提示相关奖励反映了既由提示又由响应共同决定的奖励。我们从信息论角度提取这两个组成部分,这不需要额外的模型。随后,我们提出了一种新的奖励学习算法,优先考虑其无提示奖励值较高的数据样本。通过 toy 示例,我们展示了提取的无提示奖励和提示相关奖励有效地特征化奖励模型的两个部分。进一步的标准评估表明,我们的方法提高了奖励模型的对齐性能和泛化能力。
引用
@article{arxiv.2504.06020,
title = {Information-Theoretic Reward Decomposition for Generalizable RLHF},
author = {Liyuan Mao and Haoran Xu and Amy Zhang and Weinan Zhang and Chenjia Bai},
journal= {arXiv preprint arXiv:2504.06020},
year = {2025}
}
备注
Work done during internships at Institute of Artificial Intelligence (TeleAI), China Telecom