SLiC-HF:基于人类反馈的序列似然校准
计算与语言
2023-05-18 v1 人工智能
摘要
从人类反馈中学习已被证明能有效地将语言模型与人类偏好对齐。过去的工作通常依赖于基于人类反馈的强化学习(RLHF),其利用在人工偏好数据上训练的奖励模型所给出的奖励分数来优化语言模型。在本工作中,我们展示了最近提出的序列似然校准(SLiC)如何也能有效地从人类偏好中学习(SLiC-HF)。此外,我们证明这可以使用为不同模型收集的人类反馈数据来完成,类似于离策略、离线的 RL 数据。在 TL;DR 摘要任务上的自动与人工评估实验表明,SLiC-HF 显著改进了有监督微调基线。此外,SLiC-HF 为过去工作中使用的 PPO RLHF 实现提供了一个有竞争力的替代方案,同时实现起来更简单、更易调参,并且在实践中计算更高效。
引用
@article{arxiv.2305.10425,
title = {SLiC-HF: Sequence Likelihood Calibration with Human Feedback},
author = {Yao Zhao and Rishabh Joshi and Tianqi Liu and Misha Khalman and Mohammad Saleh and Peter J. Liu},
journal= {arXiv preprint arXiv:2305.10425},
year = {2023}
}