中文

用于图像描述的X-线性注意力网络

计算机视觉与模式识别 2020-04-01 v1

摘要

细粒度视觉识别与视觉问答的最新进展采用了双线性池化(Bilinear Pooling),有效建模了多模态输入间的二阶交互。然而,尚无证据支持在图像描述中将该类交互与注意力机制同步构建。本文引入一种统一注意力模块——X-线性注意力模块(X-Linear attention block),充分利用双线性池化选择性地利用视觉信息或进行多模态推理。技术上,X-线性注意力模块同时利用空间与通道维度的双线性注意力分布,以捕获输入单模态或多模态特征间的二阶交互。通过堆叠多个X-线性注意力模块,并以无参数方式为该模块配备指数线性单元(ELU),可便捷地建模更高阶乃至无穷阶特征交互。此外,我们提出X-线性注意力网络(称为X-LAN),其新颖地将X-线性注意力模块集成到图像描述模型的图像编码器与句子解码器中,以利用更高阶的模态内与模态间交互。在COCO基准上的实验表明,我们的X-LAN在COCO Karpathy测试集上取得了迄今最佳的已发表CIDEr性能132.0%。当进一步将Transformer赋予X-线性注意力模块时,CIDEr提升至132.8%。源代码见 \url{https://github.com/Panda-Peter/image-captioning}。

关键词

引用

@article{arxiv.2003.14080,
  title  = {X-Linear Attention Networks for Image Captioning},
  author = {Yingwei Pan and Ting Yao and Yehao Li and Tao Mei},
  journal= {arXiv preprint arXiv:2003.14080},
  year   = {2020}
}

备注

CVPR 2020; The source code and model are publicly available at: https://github.com/Panda-Peter/image-captioning