一种用于序列预测的 Actor-Critic 算法
机器学习
2017-03-06 v3
摘要
我们提出了一种利用强化学习 (RL) 中的 actor-critic 方法来训练神经网络生成序列的方法。当前的似然训练方法受限于其训练与测试模式之间的差异,因为模型必须基于其先前的猜测而非真实 token 来生成 token。我们通过引入一个 critic 网络来解决这个问题,该网络被训练以在给定 actor 网络策略的情况下预测输出 token 的价值。这使得训练过程更接近测试阶段,并允许我们直接优化特定任务的分数,例如 BLEU。关键在于,由于我们在监督学习设置而非传统 RL 设置中利用这些技术,我们将 critic 网络以真实输出为条件。我们表明,我们的方法在合成任务和德英机器翻译上均带来了性能提升。我们的分析为将此类方法应用于自然语言生成任务(如机器翻译、图像描述生成和对话建模)铺平了道路。
引用
@article{arxiv.1607.07086,
title = {An Actor-Critic Algorithm for Sequence Prediction},
author = {Dzmitry Bahdanau and Philemon Brakel and Kelvin Xu and Anirudh Goyal and Ryan Lowe and Joelle Pineau and Aaron Courville and Yoshua Bengio},
journal= {arXiv preprint arXiv:1607.07086},
year = {2017}
}