用于图像-文本匹配的相似性推理与过滤
计算机视觉与模式识别
2021-01-06 v1 多媒体
摘要
图像-文本匹配在连接视觉与语言中起着关键作用,通过利用图像与句子间的全局对齐或区域与词间的局部对齐已取得巨大进展。然而,如何充分利用这些对齐推断更精确的匹配分数仍待探索。本文提出一种新颖的相似性图推理与注意力过滤(SGRAF)网络用于图像-文本匹配。具体而言,首先学习基于向量的相似性表示,以更全面刻画局部与全局对齐,然后引入依赖于一个图卷积神经网络的相似性图推理(SGR)模块,利用局部与全局对齐推断关系感知的相似性。进一步开发相似性注意力过滤(SAF)模块,通过选择性关注显著且具代表性的对齐,同时摒弃无意义对齐的干扰,来有效整合这些对齐。我们在 Flickr30K 与 MSCOCO 数据集上以取得最先进性能证明了所提方法的优越性,并通过大量定性实验与分析展示了 SGR 与 SAF 模块的良好可解释性。
引用
@article{arxiv.2101.01368,
title = {Similarity Reasoning and Filtration for Image-Text Matching},
author = {Haiwen Diao and Ying Zhang and Lin Ma and Huchuan Lu},
journal= {arXiv preprint arXiv:2101.01368},
year = {2021}
}
备注
14 pages, 8 figures, Accepted by AAAI2021