中文

基于反事实批判多智能体学习的非自回归图像描述生成

计算与语言 2020-05-12 v1 计算机视觉与模式识别 机器学习

摘要

大多数图像描述模型都是自回归的,即它们通过以先前生成的词为条件来生成每个词,这导致推理过程中的高延迟。近来,非自回归解码被提出用于机器翻译,通过并行生成所有词来加快推理时间。通常,这些模型使用词级交叉熵损失独立地优化每个词。然而,此类学习过程未能考虑句子级一致性,从而导致这些非自回归模型的生成质量较差。本文中,我们提出一种非自回归图像描述(NAIC)模型,并配以新颖的训练范式:反事实批判多智能体学习(CMAL)。CMAL 将 NAIC 构建为一个多智能体强化学习系统,其中目标序列中的位置被视为智能体,学习协作以最大化句子级奖励。此外,我们提出利用大量无标注图像来提升描述性能。在 MSCOCO 图像描述基准上的大量实验表明,我们的 NAIC 模型取得了与最先进自回归模型相当的性能,同时带来了 13.9 倍的译码加速。

关键词

引用

@article{arxiv.2005.04690,
  title  = {Non-Autoregressive Image Captioning with Counterfactuals-Critical Multi-Agent Learning},
  author = {Longteng Guo and Jing Liu and Xinxin Zhu and Xingjian He and Jie Jiang and Hanqing Lu},
  journal= {arXiv preprint arXiv:2005.04690},
  year   = {2020}
}

备注

IJCAI 2020 (copyright held by IJCAI)