用于图文匹配的堆叠交叉注意力
计算机视觉与模式识别
2018-07-24 v2 人工智能
机器学习
摘要
在本文中,我们研究图文匹配问题。推断物体或其他显著事物(如雪、天空、草坪)与句子中对应词之间的潜在语义对齐,能够捕捉视觉与语言之间细粒度的交互,并使图文匹配更具可解释性。先前的工作要么简单地聚合所有可能的区域与词对的相似度,而没有对更重要和次要的词或区域进行差异化关注,要么使用多步注意力过程来捕捉有限数量的语义对齐,这缺乏可解释性。在本文中,我们提出堆叠交叉注意力,利用图像区域和句子中的词作为上下文来发现完整的潜在对齐,并推断图文相似度。我们的方法在MS-COCO和Flickr30K数据集上取得了最先进的结果。在Flickr30K上,我们的方法在以图搜文上相对当前最佳方法提升了22.1%,在以文搜图上相对提升了18.2%(基于Recall@1)。在MS-COCO上,我们的方法将句子检索相对提升了17.8%,图像检索相对提升了16.6%(基于使用5K测试集的Recall@1)。代码已公开于:https://github.com/kuanghuei/SCAN。
引用
@article{arxiv.1803.08024,
title = {Stacked Cross Attention for Image-Text Matching},
author = {Kuang-Huei Lee and Xi Chen and Gang Hua and Houdong Hu and Xiaodong He},
journal= {arXiv preprint arXiv:1803.08024},
year = {2018}
}
备注
Accepted to ECCV 2018