中文

在线自偏好语言模型

机器学习 2024-05-24 v1

摘要

与人类偏好数据集对齐是大型语言模型(LLM)成功的关键因素。强化学习从人类反馈(RLHF)采用代价高昂的奖励模型来提供针对于策略采样响应的反馈。最近,一种直接拟合数据集中二元偏好的离线方法已涌现作为替代方案。然而,现有方法未显式建模偏好强度信息,而这一信息对于区分不同响应对至关重要。为克服这一局限,我们提出一种在线自偏好(OSP)语言模型,通过学习自生成的响应对及其自判定的偏好强度来实现。对于每个提示及其对应的自生成响应,我们引入一种排序配对方法,以构建具有偏好强度信息的多个响应对。随后,我们提出软偏好交叉熵损失以利用此类信息。实证研究表明,利用偏好强度对于避免过拟合和增强对齐性能至关重要。OSP在两个广泛使用的 human preference 数据集中的各种指标上均实现了最先进的对齐性能。OSP参数高效,且在离线数据有限且针对外域任务时比主导的在线方法RLHF更具鲁棒性。此外,OSP语言模型建立的LLM在具备自偏好能力后,可无需外部监督即可高效自我改进。

关键词

引用

@article{arxiv.2405.14103,
  title  = {Online Self-Preferring Language Models},
  author = {Yuanzhao Zhai and Zhuo Zhang and Kele Xu and Hanyang Peng and Yue Yu and Dawei Feng and Cheng Yang and Bo Ding and Huaimin Wang},
  journal= {arXiv preprint arXiv:2405.14103},
  year   = {2024}
}

备注

20 pages, 9 figures