ESRL:基于高效采样的序列生成强化学习
计算与语言
2023-08-07 v1
摘要
将强化学习(RL)应用于序列生成模型能够直接优化长期奖励(例如 BLEU 和人类反馈),但通常需要在动作序列空间上进行大规模采样。这是序列生成问题(如机器翻译)实践中提出的一个计算挑战,其中我们经常处理大的动作空间(例如词汇表)和长的动作序列(例如译文)。在这项工作中,我们引入了两阶段采样和动态采样方法,以通过 RL 训练序列生成模型时提高采样效率。我们在传统的序列生成任务上验证了我们的方法,包括机器翻译和抽象式摘要。此外,我们通过使用奖励模型训练大语言模型,在基于人类反馈的强化学习(RLHF)中评估了我们的方法。实验结果表明,这种称为 ESRL 的基于高效采样的 RL 在训练效率和内存消耗方面均优于所有基线。值得注意的是,ESRL 相比强大的 REINFORCE、最小风险训练和近端策略优化方法取得了持续的性能提升。
引用
@article{arxiv.2308.02223,
title = {ESRL: Efficient Sampling-based Reinforcement Learning for Sequence Generation},
author = {Chenglong Wang and Hang Zhou and Yimin Hu and Yifu Huo and Bei Li and Tongran Liu and Tong Xiao and Jingbo Zhu},
journal= {arXiv preprint arXiv:2308.02223},
year = {2023}
}