中文

宏动作强化学习:基于人类反馈的强化学习方法

计算与语言 2025-02-18 v2

摘要

基于人类反馈的强化学习(RLHF)在与人类偏好一致性方面已证明有效。然而,基于token的RLHF在长序列上存在信用分配问题,由于延迟奖励,使得模型难以辨认哪些动作导致了受偏好影响的结果。这会限制学习效率并减缓收敛速度。本文提出了MA-RLHF,这是一个简洁且有效的RLHF框架,纳入了宏动作——即一系列token或更高层次的语言构件——以纳入学习过程。通过以更高的抽象层次运作,我们的方法缩短了动作与奖励之间的时间距离,促进了更快速和更准确的信用分配。这导致更稳定的策略梯度估计,提高了每个episode内的学习效率,同时不会增加训练或推理期间的计算复杂度。我们通过广泛的实验验证了这一方法,包括文本摘要、对话生成、问答和程序合成等各种模型规模和任务。我们的方法在标准RLHF上实现了显著的性能提升,在文本摘要和代码生成中提升了最高可达30%,对话中提升18%,问答中提升8%。值得注意的是,我们的方法在训练时间上仅需vanilla RLHF的1.7~2倍即可达到相当于其性能的水平,并且随着进一步训练仍能超越它。我们在https://github.com/ernie-research/MA-RLHF上公开了代码和数据。

关键词

引用

@article{arxiv.2410.02743,
  title  = {MA-RLHF: Reinforcement Learning from Human Feedback with Macro Actions},
  author = {Yekun Chai and Haoran Sun and Huang Fang and Shuohuan Wang and Yu Sun and Hua Wu},
  journal= {arXiv preprint arXiv:2410.02743},
  year   = {2025}
}