无需人类反馈的强化学习用于大语言模型的最后一公里微调
计算与语言
2024-08-30 v1 机器学习
摘要
强化学习用于在首先使用似然最大化在大型语料库中预训练模型以预测下一个文本 token 之后,使语言模型与人类偏好信号对齐。在部署到特定领域之前,模型通常会在任务特定数据上进一步微调。由于在最后一步中通常无法获得人类偏好,因此使用似然最大化来执行,因为这是典型的默认方法。然而,除了促进与人类衍生的奖励函数的对齐之外,强化学习还有其他优势。首先,似然最大化是一种模仿学习,即在理想条件下训练模型该做什么,而强化学习不仅限于为最优到达状态演示动作,而是在探索策略空间时训练模型在各种场景下该做什么。此外,它还训练模型不该做什么,抑制具有竞争力但糟糕的动作。这项工作开发了一个使用强化学习进行最后一公里微调的框架,并测试其是否能带来性能提升。实验以生成式摘要为中心,但该框架是通用的且具有广泛适用性。在比较原始预测时,使用该程序产生的结果显著优于似然最大化。对于测试的特定数据,通过对最大似然输出进行后处理可以弥合这一差距。尽管如此,该框架在后处理可能不那么直接或有效的情况下为模型优化提供了一条新途径,并且可以扩展到包含更复杂类别的不可取输出以进行惩罚和对抗训练,例如幻觉。
引用
@article{arxiv.2408.16753,
title = {Reinforcement Learning without Human Feedback for Last Mile Fine-Tuning of Large Language Models},
author = {Alec Solway},
journal= {arXiv preprint arXiv:2408.16753},
year = {2024}
}