中文

SeRA:使用隐式奖励边际进行大语言模型的自我审查与对齐

机器学习 2024-10-15 v1 人工智能

摘要

直接对齐算法 (DAA),如直接偏好优化 (DPO),因其简单性、效率和稳定性而在强化学习从人类反馈 (RLHF) 中流行。然而,DAA中使用的偏好通常是在对齐训练开始之前收集的,并且保持不变(离策略)。这可能导致策略模型(1)在数据集中捕捉到不必要的相关性(而不是学习在人类偏好标签中表达的预期对齐),以及(2)过拟合到离策略轨迹上的反馈,这些轨迹的生成概率较低。为了解决这些问题,我们引入了一种自我审查与对齐 (SeRA) 方法,该方法具有成本效益高且有效,可以轻易地与现有的DAA结合。SeRA包括两个组件:(1)使用隐式奖励边际进行样本选择,这有助于缓解对某些不必要特征的过拟合;(2)使用隐式奖励进行偏好引导,通过成本效益高的方式使用更新的策略模型扩充偏好数据。广泛的实验,包括一些针对指令遵循任务的实验,表明SeRA在使用DAA在离线偏好数据集上训练大语言模型时具有有效性和通用性。

关键词

引用

@article{arxiv.2410.09362,
  title  = {SeRA: Self-Reviewing and Alignment of Large Language Models using Implicit Reward Margins},
  author = {Jongwoo Ko and Saket Dingliwal and Bhavana Ganesh and Sailik Sengupta and Sravan Bodapati and Aram Galstyan},
  journal= {arXiv preprint arXiv:2410.09362},
  year   = {2024}
}