中文

Reflect-RL:用于语言模型的双人在线强化学习微调

机器学习 2024-06-07 v2 计算与语言

摘要

随着语言模型在各个领域展现出其能力,它们在需要多轮交互的任务中的应用日益普及。这些任务通常具有复杂的动态特性,因此在有限的离线数据集上进行有监督微调(SFT)无法取得良好的性能。然而,仅有少数工作尝试在交互式决策环境中直接训练语言模型。我们旨在为这些环境中的语言模型提出一种有效的在线强化学习(RL)微调方法。我们提出了 Reflect-RL,这是一个利用 SFT 和在线 RL 微调语言模型的双人系统,其中一个冻结的反思模型(玩家)协助策略模型(玩家)。为了为预热 SFT 阶段生成数据,我们使用负样本生成来增强反思模型的纠错能力。此外,我们设计了单提示动作枚举并应用了课程学习,使策略模型能够更高效地学习。在实验上,我们验证了 Reflect-RL 优于无反思的 SFT 和在线 RL。测试结果表明,使用 Reflect-RL 微调的 GPT-2 XL 1.56B 优于更大的开源语言模型,例如 Mistral 7B。本工作涉及的基准测试、数据集和代码已公开提供:https://github.com/zhourunlong/Reflect-RL。

关键词

引用

@article{arxiv.2402.12621,
  title  = {Reflect-RL: Two-Player Online RL Fine-Tuning for LMs},
  author = {Runlong Zhou and Simon S. Du and Beibin Li},
  journal= {arXiv preprint arXiv:2402.12621},
  year   = {2024}
}

备注

ACL 2024