基于交换引导的偏好学习用于人类反馈的个性化强化学习
机器学习
2026-03-16 v1 人工智能
摘要
从人类反馈进行强化学习 (RLHF) 是一种广泛用于将大规模 AI 系统与人类价值观对齐的方法。然而,RLHF 通常假设单一、通用的奖励,忽略了多样化的偏好,限制了个性化。变分偏好学习 (VPL) 旨在通过引入用户特定的隐变量来解决这一问题。尽管前景光明,但我们发现 VPL 存在后验塌陷。尽管这一现象在变分自编码器中众所周知,但它在偏好学习框架中尚未被识别。 在稀疏偏好数据且解码器过于灵活的情况下,VPL 可能导致隐变量被忽略,恢复到单一奖励模型。为克服这一局限,我们提出交换引导的偏好学习 (SPL)。核心思想是构建虚构的交换标注者并利用其偏好的镜像属性来指导编码器。SPL 引入三个组件:(1) 交换引导的基准正则化,(2) 优先逆自回归流 (P-IAF),和 (3) 自适应隐变量条件。实验表明,SPL 缓解了塌陷,丰富了用户特定的隐变量,并提高了偏好预测性能。我们的代码和数据已在 https://github.com/cobang0111/SPL 上提供。
关键词
引用
@article{arxiv.2603.12595,
title = {Swap-guided Preference Learning for Personalized Reinforcement Learning from Human Feedback},
author = {Gihoon Kim and Euntai Kim},
journal= {arXiv preprint arXiv:2603.12595},
year = {2026}
}
备注
ICLR 2026