中文

用于图像描述的多视角视觉表示多模态 Transformer

计算机视觉与模式识别 2019-05-21 v1

摘要

图像描述旨在为给定图像自动生成自然语言描述,大多数最先进模型采用了编码器-解码器框架。该框架由基于卷积神经网络(CNN)的图像编码器(从输入图像提取基于区域的视觉特征)和基于循环神经网络(RNN)的描述解码器(借助注意力机制基于视觉特征生成输出描述词)组成。尽管现有研究取得成功,当前方法仅建模表征模态间交互的共注意力,而忽略了表征模态内交互的自注意力。受 Transformer 模型在机器翻译中成功的启发,我们在此将其扩展为用于图像描述的多模态 Transformer(MT)模型。与现有图像描述方法相比,MT 模型在统一注意力块中同时捕获模态内与模态间交互。由于此类注意力块的深度模块化组合,MT 模型可执行复杂多模态推理并输出准确描述。此外,为进一步提升图像描述性能,多视角视觉特征被无缝引入 MT 模型。我们使用基准 MSCOCO 图像描述数据集对我们的方法进行了定量与定性评估,并开展广泛消融实验以探究其有效性背后的原因。实验结果表明,我们的方法显著优于先前最先进方法。通过七个模型的集成,我们的方案在本文撰写时位列 MSCOCO 图像描述挑战赛实时排行榜第一。

关键词

引用

@article{arxiv.1905.07841,
  title  = {Multimodal Transformer with Multi-View Visual Representation for Image Captioning},
  author = {Jun Yu and Jing Li and Zhou Yu and Qingming Huang},
  journal= {arXiv preprint arXiv:1905.07841},
  year   = {2019}
}

备注

submitted to a journal