超越静态人类提示的可扩展强化后训练:通过非对称自博弈实现对齐演化
计算与语言
2025-04-11 v3 人工智能
数据分析、统计与概率
机器学习
摘要
当前用于大语言模型(LLM)后训练的强化学习(RL)框架通常假设固定的提示分布,这并非最优且限制了可扩展性。先前的工作探索了提示演化,但往往局限于监督微调阶段,且提示的采样和演化缺乏信号引导且方式单一。本实证研究提出了一种范式转变:通过非对称自博弈实现对齐演化(EVA),将后训练建模为一个包含两个参与者的、基于遗憾信号的无限博弈:(i)创建者,负责策略性地采样并创建新的信息性提示;(ii)求解器,负责学习生成更优的响应。EVA 是首个允许语言模型在离线和在线 RL 后训练中自适应创建训练提示的方法。其设计简单、易用且效果显著:EVA 在具有挑战性的基准测试上取得了新的 SOTA 成绩,无需任何额外的人工提示,例如,它将 gemma-2-9b-it 在 Arena-Hard 上的胜率从 51.6% 提升至 60.1%(使用 DPO)和从 52.6% 提升至 62.4%(使用 RLOO),超越了 claude-3-opus 并接近 gemini-1.5-pro,而后两者的模型规模大几个数量级。大量实验表明,EVA 能创建有效的 RL 课程,并且在消融实验中表现稳健。我们相信,自适应演化的提示是设计下一代 RL 后训练方案的关键。
引用
@article{arxiv.2411.00062,
title = {Scalable Reinforcement Post-Training Beyond Static Human Prompts: Evolving Alignment via Asymmetric Self-Play},
author = {Ziyu Ye and Rishabh Agarwal and Tianqi Liu and Rishabh Joshi and Sarmishta Velury and Quoc V. Le and Qijun Tan and Yuan Liu},
journal= {arXiv preprint arXiv:2411.00062},
year = {2025}
}
备注
spotlight @ neurips language gamification workshop. updated the problem description and added new online RL experiments in this version