中文

直接对齐中的对数似然平均化

机器学习 2024-06-28 v1

摘要

为更好地将大语言模型 (LLM) 与人类判断一致,强化学习从人类反馈 (RLHF) 学习奖励模型,然后对其进行正则化优化。最近引入的直接对齐方法从偏好数据集直接学习微调模型,而无需计算代理奖励函数。这些方法基于模型对(不)偏好完成项的对数似然构建对比损失。然而,完成项的长度各不相同,对数似然不具尺度不变性。另一方面,监督训练中使用的交叉熵损失在按标记平均时具有尺度不变性。为协调这些方法,我们引入一种原则化的方法,使直接对齐具有尺度不变性。形式地,我们引入一种新的平均运算符,可与给定底层 RL 问题最优策略算子组合。它转化为对损失中的对数似然进行平均。我们经验性地研究了这种平均化的效果,观察到生成长度与得分之间存在一种权衡。

关键词

引用

@article{arxiv.2406.19188,
  title  = {Averaging log-likelihoods in direct alignment},
  author = {Nathan Grinsztajn and Yannis Flet-Berliac and Mohammad Gheshlaghi Azar and Florian Strub and Bill Wu and Eugene Choi and Chris Cremer and Arash Ahmadian and Yash Chandak and Olivier Pietquin and Matthieu Geist},
  journal= {arXiv preprint arXiv:2406.19188},
  year   = {2024}
}