中文

相对未来回归:多轮 RLHF 的高效策略优化

机器学习 2025-04-25 v2 人工智能 计算与语言

摘要

大型语言模型(LLM)在需要单轮交互的任务(如摘要)方面取得了显著成功,但在需要长期规划的多轮任务(如对话)中仍表现不佳。先前的多轮对话方法通过将所有先前的对话轮次视为长上下文来扩展单轮强化学习从人类反馈(RLHF)方法,但这些方法受到协变量漂移的限制:训练集中的对话由某些参考策略生成,导致低训练误差不一定对应实际对话循环中的良好性能。为此,我们引入了 REgressing the RELative FUture(REFUEL),一种旨在解决 LLM 多轮 RLHF 的高效策略优化方法。REFUEL 使用单个模型估计 Q 值,并训练于自生成数据,解决协变量漂移问题。REFUEL 将多轮 RLHF 问题建模为一系列在迭代收集的数据集上的回归任务,实现了简便的实现。理论上,我们证明 REFUEL 能匹配训练集中覆盖的任何策略的性能。实验上,我们使用 Llama-3.1-70B-it 模拟与模型对话的用户。REFUEL 在各种设置下一致优于 DPO 和 REBEL 等最先进方法。此外,尽管仅有 80 亿参数,经 REFUEL 微调的 Llama-3-8B-it 在长期多轮对话中仍优于 Llama-3.1-70B-it。REFUEL 的实现可见于 https://github.com/ZhaolinGao/REFUEL/,经 REFUEL 训练的模型可见于 https://huggingface.co/Cornell-AGI。

关键词

引用

@article{arxiv.2410.04612,
  title  = {Regressing the Relative Future: Efficient Policy Optimization for Multi-turn RLHF},
  author = {Zhaolin Gao and Wenhao Zhan and Jonathan D. Chang and Gokul Swamy and Kianté Brantley and Jason D. Lee and Wen Sun},
  journal= {arXiv preprint arXiv:2410.04612},
  year   = {2025}
}