利用人类反馈强化学习训练有用且无害的助手
计算与语言
2022-04-13 v1 机器学习
摘要
我们应用偏好建模与人类反馈强化学习(RLHF)对语言模型进行微调,使其充当有用且无害的助手。我们发现这种对齐训练在几乎所有 NLP 评测上的表现都有所提升,并且与针对特定技能(如 python 编程与摘要生成)的训练完全兼容。我们探索了一种迭代在线训练模式,其中偏好模型与 RL 策略以每周为周期利用新采集的人类反馈数据进行更新,从而高效地改进我们的数据集与模型。最后,我们研究了 RLHF 训练的鲁棒性,并发现 RL 奖励与策略和其初始化之间 KL 散度的平方根之间存在近似线性关系。除主要结果外,我们还对校准、竞争目标、OOD 检测的使用进行了外围分析,将我们的模型与人类写作者进行比较,并使用近期相关工作中出现的提示词提供了我们模型的生成样本。
引用
@article{arxiv.2204.05862,
title = {Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback},
author = {Yuntao Bai and Andy Jones and Kamal Ndousse and Amanda Askell and Anna Chen and Nova DasSarma and Dawn Drain and Stanislav Fort and Deep Ganguli and Tom Henighan and Nicholas Joseph and Saurav Kadavath and Jackson Kernion and Tom Conerly and Sheer El-Showk and Nelson Elhage and Zac Hatfield-Dodds and Danny Hernandez and Tristan Hume and Scott Johnston and Shauna Kravec and Liane Lovitt and Neel Nanda and Catherine Olsson and Dario Amodei and Tom Brown and Jack Clark and Sam McCandlish and Chris Olah and Ben Mann and Jared Kaplan},
journal= {arXiv preprint arXiv:2204.05862},
year = {2022}
}
备注
Data available at https://github.com/anthropics/hh-rlhf