通过优势模型与选择性重演稳定化 RLHF
计算与语言
2023-09-20 v1 人工智能
摘要
大语言模型(LLMs)已彻底改变了自然语言处理,但利用 RLHF 将这些模型与人类价值观和偏好对齐仍是一项重大挑战。该挑战表现为多种不稳定性,例如奖励 hacking(作弊)与灾难性遗忘。在本技术报告中,我们提出两项创新以稳定 RLHF 训练:1)优势模型(Advantage Model),其直接对优势分数(即相对于期望奖励的额外奖励)进行建模,并调节跨任务的分数分布以防止奖励 hacking;2)选择性重演(Selective Rehearsal),其通过策略性地选择数据进行 PPO 训练与知识重演来缓解灾难性遗忘。我们在公开与专有数据集上的实验分析表明,所提方法不仅提升了 RLHF 训练的稳定性,还取得了更高的奖励分数与胜率。
引用
@article{arxiv.2309.10202,
title = {Stabilizing RLHF through Advantage Model and Selective Rehearsal},
author = {Baolin Peng and Linfeng Song and Ye Tian and Lifeng Jin and Haitao Mi and Dong Yu},
journal= {arXiv preprint arXiv:2309.10202},
year = {2023}
}
备注
9 pages, working in progress