用于视觉段落生成的 Transformer 离策略自批判训练
计算机视觉与模式识别
2020-06-23 v1 机器学习
摘要
近来,已有若干方法被提出以解决语言生成问题。Transformer 是当前语言生成中 state-of-the-art 的 seq-to-seq 模型。强化学习(RL)在解决 seq-to-seq 语言学习中的暴露偏差与非可微度量优化方面很有用。然而,Transformer 难以与 RL 结合,因为采样需要昂贵的计算资源。我们通过提出一种离策略 RL 学习算法来解决此问题,其中由 GRU 表示的行为策略执行采样。我们应用截断相对重要性采样(TRIS)技术与 Kullback-Leibler (KL)-control 概念来降低重要性采样(IS)的高方差。TRIS 是一种简单而有效的技术,且有理论证明 KL-control 有助于降低 IS 的方差。我们基于自批判序列训练构建了此离策略 RL。具体地,我们使用基于 Transformer 的描述生成模型作为目标策略,并使用图像引导的语言自编码器作为行为策略来探索环境。所提算法在视觉段落生成上取得 state-of-the-art 性能,并在图像描述上获得改进结果。
引用
@article{arxiv.2006.11714,
title = {Off-Policy Self-Critical Training for Transformer in Visual Paragraph Generation},
author = {Shiyang Yan and Yang Hua and Neil M. Robertson},
journal= {arXiv preprint arXiv:2006.11714},
year = {2020}
}