掩码非自回归图像描述生成
计算机视觉与模式识别
2019-06-04 v1
摘要
现有的描述生成模型通常采用编码器-解码器架构,其中解码器使用自回归解码来生成描述,从而每个词元在给定先前生成词元的条件下顺序生成。然而,自回归解码会导致顺序误差累积、生成缓慢、语义不当以及缺乏多样性等问题。非自回归解码已被提出用于解决神经机器翻译中的生成缓慢问题,但由于对目标分布的间接建模而受到多模态问题的困扰。在本文中,我们提出掩码非自回归解码,以解决自回归解码与非自回归解码两方面的问题。在掩码非自回归解码中,我们在训练期间对输入序列的若干种比例进行掩码,并在推理期间以组合方式从完全掩码的序列到完全未掩码的序列分多个阶段并行生成描述。实验上,我们提出的模型能更有效地保留语义内容,并能生成更多样化的描述。
引用
@article{arxiv.1906.00717,
title = {Masked Non-Autoregressive Image Captioning},
author = {Junlong Gao and Xi Meng and Shiqi Wang and Xia Li and Shanshe Wang and Siwei Ma and Wen Gao},
journal= {arXiv preprint arXiv:1906.00717},
year = {2019}
}