ParNet:用于图文匹配的位置感知聚合关系网络
计算机视觉与模式识别
2019-06-18 v1 计算与语言
机器学习
多媒体
摘要
探索实体(如图像中的物体或句子中的词)之间的细粒度关系对精准理解多媒体内容有很大帮助。先前用于图文匹配的注意力机制要么通过多步自注意力来收集对应关系,要么以图像物体(或词)作为上下文来推断图文相似度。然而,它们仅利用了语义信息,未考虑物体的相对位置同样有助于图像理解。为此,本文引入一种新颖的位置感知关系模块,在图文匹配中同时建模语义与空间关系。给定一幅图像,我们的方法利用不同物体的位置创新性地捕捉空间关系。结合语义与空间关系,更容易理解不同模态(图像与句子)的内容并捕捉图文对的细粒度潜在对应。此外,我们采用两步聚合关系模块来捕捉可解释的图文对齐:第一步称为模态内关系机制,分别计算一幅图像中不同物体之间或一句句子中不同词之间的响应;第二步称为模态间关系机制,其中查询充当文本上下文以细化图像中物体候选框之间的关系。由此,我们的位置感知聚合关系网络(ParNet)不仅能通过自适应关注不同物体(词)知晓哪些实体相关,还能依据查询内容按潜在对齐调整模态间对应。我们的方法在MS-COCO数据集上取得了SOTA结果。
引用
@article{arxiv.1906.06892,
title = {ParNet: Position-aware Aggregated Relation Network for Image-Text matching},
author = {Yaxian Xia and Lun Huang and Wenmin Wang and Xiaoyong Wei and Wenmin Wang},
journal= {arXiv preprint arXiv:1906.06892},
year = {2019}
}
备注
9 pages, 3 figures