RLHF 中的奖励泛化:拓扑视角
机器学习
2025-05-29 v7 人工智能
计算与语言
离散数学
摘要
现有的对齐方法共享一种共同的信息流拓扑,其中奖励信息从人类收集,通过偏好学习进行建模,并用于微调语言模型。然而,这种共享的拓扑结构尚未得到系统表征,其替代方案也未得到充分探索,导致数据效率低和泛化不可靠的问题仍未解决。作为解决方案,我们引入了基于人类反馈的强化学习 (RLHF) 中的奖励泛化理论,重点关注宏观和微观层面的信息流拓扑。在宏观层面,我们将 RLHF 信息流描绘为行为分布上的自编码过程,形式化了人类偏好与模型行为之间分布一致性的 RLHF 目标。在微观层面,我们提出了诱导贝叶斯网络来模拟数据集拓扑对奖励泛化的影响。结合两个层面的分析,我们提出了基于树状结构偏好信息的奖励建模。结果显示,与基线相比,它将奖励不确定性降低了高达 倍,其中 是数据集大小。在三个 NLP 任务上的验证表明,其相对于基线的平均胜率达到 65%,从而通过拓扑设计免费提高了奖励泛化能力,同时减少了需要标注的数据量。
引用
@article{arxiv.2402.10184,
title = {Reward Generalization in RLHF: A Topological Perspective},
author = {Tianyi Qiu and Fanzhi Zeng and Jiaming Ji and Dong Yan and Kaile Wang and Jiayi Zhou and Yang Han and Josef Dai and Xuehai Pan and Yaodong Yang},
journal= {arXiv preprint arXiv:2402.10184},
year = {2025}
}
备注
46 pages, ACL 2025 (Findings)