基于离线人类反馈学习的语言模型对齐
计算与语言
2023-12-12 v2 人工智能
摘要
从人类偏好中学习对于语言模型(LMs)有效满足人类需求和社会价值至关重要。先前的研究利用人类反馈遵循指令已取得显著进展。然而,这些方法主要依赖近端策略优化(PPO)等在线学习技术,已被证明对语言模型而言不稳定且难以调优。此外,PPO需要复杂的分布式系统实现,阻碍了大规模分布式训练的效率。在本研究中,我们提出一种离线人类反馈学习框架,以在不与环境交互的情况下对齐语言模型。具体而言,我们探索了过滤对齐(FA)、奖励加权回归(RWR)和条件对齐(CA)来将语言模型对齐到人类偏好。通过采用类似于监督微调的损失函数,我们的方法确保了比PPO更稳定的模型训练,且仅需简单的机器学习系统(MLSys)和少得多(约9%)的计算资源。实验结果表明,条件对齐优于其他离线对齐方法,并与PPO相当。
引用
@article{arxiv.2308.12050,
title = {Aligning Language Models with Offline Learning from Human Feedback},
author = {Jian Hu and Li Tao and June Yang and Chandler Zhou},
journal= {arXiv preprint arXiv:2308.12050},
year = {2023}
}