中文

通过图像 Transformer 进行图像描述生成

计算机视觉与模式识别 2020-10-06 v2

摘要

图像的自动描述生成是一项结合了图像分析与文本生成挑战的任务。描述生成中的一个重要方面是注意力的概念:如何决定描述什么以及以何种顺序描述。受文本分析与翻译成功的启发,先前工作已提出将 transformer 架构用于图像描述生成。然而,图像中语义单元(通常是目标检测模型检测到的区域)与句子(每个单词)之间的结构是不同的。在使 transformer 内部架构适应图像方面所做的工作有限。在本工作中,我们引入了图像 transformer,其由改进的编码 transformer 和隐式解码 transformer 组成,动机源于图像区域之间的相对空间关系。我们的设计拓宽了原始 transformer 层的内在架构以适应图像的结构。仅以区域特征作为输入,我们的模型在 MSCOCO 离线和在线测试基准上都取得了新的 SOTA 性能。

关键词

引用

@article{arxiv.2004.14231,
  title  = {Image Captioning through Image Transformer},
  author = {Sen He and Wentong Liao and Hamed R. Tavakoli and Michael Yang and Bodo Rosenhahn and Nicolas Pugeault},
  journal= {arXiv preprint arXiv:2004.14231},
  year   = {2020}
}