面向序列到序列模型的深度强化学习
机器学习
2019-04-17 v4 机器学习
摘要
近年来,序列到序列(seq2seq)模型广受欢迎,并在机器翻译、标题生成、文本摘要、语音转文本和图像字幕生成等多种任务中提供最先进的性能。所有这些模型的底层框架通常是包含编码器和解码器的深度神经网络。尽管简单的编码器-解码器模型能产生有竞争力的结果,许多研究者已提出对这些序列到序列模型的额外改进,例如使用基于输入的注意力模型、指针生成模型和自注意力模型。然而,此类 seq2seq 模型存在两个常见问题:1) 暴露偏差和 2) 训练/测试度量不一致。最近,在解决 seq2seq 模型中这两个问题时出现了一种全新视角,即利用强化学习(RL)的方法。在本综述中,我们从 RL 视角考量 seq2seq 问题,并提供一种结合 RL 方法在决策中的能力与能记忆长期记忆的序列到序列模型的表述。我们介绍一些结合 RL 与深度神经网络概念的最新框架,并解释这两个领域如何相互受益以解决复杂的 seq2seq 任务。我们的工作旨在深入剖析当前方法固有产生的一些问题,以及我们如何用更好的 RL 模型来解决它们。我们还提供了实现本文讨论的大多数 RL 模型的源代码,以支持抽象文本摘要这一复杂任务。
引用
@article{arxiv.1805.09461,
title = {Deep Reinforcement Learning For Sequence to Sequence Models},
author = {Yaser Keneshloo and Tian Shi and Naren Ramakrishnan and Chandan K. Reddy},
journal= {arXiv preprint arXiv:1805.09461},
year = {2019}
}