从密度估计视角看基于成对人类偏好的学习
机器学习
2024-01-11 v3 人工智能
计算与语言
摘要
从人类反馈中学习(LHF)——尤其是从成对偏好中学习——近来已成为训练大语言模型(LLM)的关键要素,并成为诸多研究的主题。多数近期工作将其框定为强化学习问题,其中从成对偏好数据学习奖励函数,并将 LLM 视为策略,在额外正则约束下调整以最大化奖励。我们提出一种替代性解释,其聚焦于成对偏好的生成过程,并将 LHF 视为密度估计问题。我们提供理论与实证结果表明,对于通过偏好行为分布方程定义的一类生成过程,在成对偏好上训练奖励函数有效地建模了标注者的隐式偏好分布。最后,我们讨论并展示了关于“标注者误设定”——即对标注者行为做出错误建模假设而导致模型适配不佳的失败案例——的发现,表明从成对人类偏好学习的方法可能在从具有多元观点的标注者群体中学习时遇到困难。
引用
@article{arxiv.2311.14115,
title = {A density estimation perspective on learning from pairwise human preferences},
author = {Vincent Dumoulin and Daniel D. Johnson and Pablo Samuel Castro and Hugo Larochelle and Yann Dauphin},
journal= {arXiv preprint arXiv:2311.14115},
year = {2024}
}