面向鲁棒偏好建模的类情境奖励适应
机器学习
2026-05-29 v1 人工智能
摘要
强化学习从人类反馈(RLHF)通常依赖静态奖励模型来对齐大型语言模型与人类偏好。然而,人类价值观本质上是多样且异质的,单个奖励模型往往缺乏对未知偏好领域的鲁棒性。虽然现有的多奖励框架试图解决这一问题,但往往受限于已知领域的固定集合,无法在不昂贵重新训练的情况下适应未见的人类分布。在本工作中,我们提出类情境奖励适应(In-Context Reward Adaptation),一个基于 transformer 的框架,旨在对鲁棒建模 diverse and unseen 人类偏好。通过利用 transformer 的类情境学习能力,我们的方法能够从小量偏好 demonstration 中自适应推断 underlying reward structure。我们展示,标准 transformer 架构对此任务不够,因其在 ground-truth 上的渐近偏差;将人类响应时间作为辅助输入信号后,模型能够成功地适应来自未见领域的偏好。我们的发现表明,这一方法为偏好建模提供了更鲁棒的基础,allow for 表示 heterogeneous rewards 与偏好分布迁移,并为更灵活的人机对齐提供可扩展的路径。
引用
@article{arxiv.2605.30323,
title = {In-Context Reward Adaptation for Robust Preference Modeling},
author = {Zhenyu Sun and Zheng Xu and Ermin Wei},
journal= {arXiv preprint arXiv:2605.30323},
year = {2026}
}