Hire: 基于多关系增强的混合模交互用于图像文本匹配
计算机视觉与模式识别
2024-06-28 v1 信息检索
摘要
图像文本匹配(Image-text matching, ITM)是计算机视觉中的一个基本问题。关键问题在于联合学习视觉和文本表示来准确估计它们的相似性。大多数现有方法关注单模内部的特征增强或跨模的特征交互,但忽略了基于对象之间关系而形成的对象表示的上下文信息,这些关系能够匹配带有丰富上下文语义的句子。在本文中,我们提出了一种基于多关系增强的混合模交互方法,称为基于关系增强的混合模交互(\textit{Hire}),用于图像文本匹配,通过隐式和显式关系建模来关联对象和单词之间的内模和跨模语义。在具体而言,我们设计了基于显式对象空间位置及其场景图关系的显式空间语义图-based推理网络,以增强视觉对象基于显式关系的上下文表示。我们使用隐式关系建模来提高显式关系检测的容错性。随后,通过跨模交互注意力和跨模对齐,联合细化视觉和文本语义表示。为将对象的上下文与文本上下文相关联,我们进一步通过跨层对象-句子和词-图像基于交互注意力来细化视觉语义表示。广泛的实验验证了所提出的基于隐式和显式建模的混合模交互对图像文本匹配更有益处。我们的方法在MS-COCO和Flickr30K基准上取得了新的最先进成绩。
引用
@article{arxiv.2406.18579,
title = {Hire: Hybrid-modal Interaction with Multiple Relational Enhancements for Image-Text Matching},
author = {Xuri Ge and Fuhai Chen and Songpei Xu and Fuxiang Tao and Jie Wang and Joemon M. Jose},
journal= {arXiv preprint arXiv:2406.18579},
year = {2024}
}
备注
22pages, 5 Figures, 6 tables, the extension of CMSEI in WACV23, and submitted to ACM TIST. arXiv admin note: text overlap with arXiv:2210.08908