中文

ESRL:基于高效采样的序列生成强化学习

计算与语言 2023-08-07 v1

摘要

将强化学习(RL)应用于序列生成模型能够直接优化长期奖励(例如 BLEU 和人类反馈),但通常需要在动作序列空间上进行大规模采样。这是序列生成问题(如机器翻译)实践中提出的一个计算挑战,其中我们经常处理大的动作空间(例如词汇表)和长的动作序列(例如译文)。在这项工作中,我们引入了两阶段采样和动态采样方法,以通过 RL 训练序列生成模型时提高采样效率。我们在传统的序列生成任务上验证了我们的方法,包括机器翻译和抽象式摘要。此外,我们通过使用奖励模型训练大语言模型,在基于人类反馈的强化学习(RLHF)中评估了我们的方法。实验结果表明,这种称为 ESRL 的基于高效采样的 RL 在训练效率和内存消耗方面均优于所有基线。值得注意的是,ESRL 相比强大的 REINFORCE、最小风险训练和近端策略优化方法取得了持续的性能提升。

关键词

引用

@article{arxiv.2308.02223,
  title  = {ESRL: Efficient Sampling-based Reinforcement Learning for Sequence Generation},
  author = {Chenglong Wang and Hang Zhou and Yimin Hu and Yifu Huo and Bei Li and Tongran Liu and Tong Xiao and Jingbo Zhu},
  journal= {arXiv preprint arXiv:2308.02223},
  year   = {2023}
}