基于图注意力学习双重语义关系用于图文匹配
计算机视觉与模式识别
2020-10-23 v1 多媒体
摘要
图文匹配是跨模态信息处理中的一项主要任务。其主要挑战在于学习统一的视觉与文本表示。此前在该任务上表现优异的方法主要关注图像中区域特征与句子中对应词语的对齐,以及区域间关系与关系词的对齐。然而,区域特征与全局特征联合学习的缺失会导致区域特征与全局上下文失去联系,从而在与某些具有全局含义的非物体词匹配时出现偏差。为缓解此问题,有必要增强区域间关系以及区域与全局概念间的关系,以获得更准确的视觉表示,从而更好地与对应文本相关联。为此,本文提出一种名为双重语义关系注意力网络(DSRAN)的多层次语义关系增强新方法,其主要由分离语义关系模块和联合语义关系模块组成。DSRAN在两个模块中分别执行图注意力,同时实现区域级关系增强和区域-全局关系增强。通过这两个模块,不同层次的语义关系被同时学习,从而为最终视觉表示提供更丰富的信息,促进图文匹配过程。在MS-COCO和Flickr30K上的定量实验结果表明,得益于双重语义关系学习方案的有效性,我们的方法大幅优于先前方法。代码见 https://github.com/kywen1119/DSRAN。
引用
@article{arxiv.2010.11550,
title = {Learning Dual Semantic Relations with Graph Attention for Image-Text Matching},
author = {Keyu Wen and Xiaodong Gu and Qingrong Cheng},
journal= {arXiv preprint arXiv:2010.11550},
year = {2020}
}
备注
14pages, 9 figures. Accepted at: IEEE Transactions on Circuits and Systems for Video Technology (Early Access Print) | |Codes Available at: https://github.com/kywen1119/DSRAN