组合对象关系与属性用于图像-文本匹配
计算机视觉与模式识别
2024-06-18 v1
摘要
我们研究图像-文本匹配的视觉语义嵌入问题。大多数现有工作利用针对性的跨注意力机制在两种图像和文本模态之间执行局部对齐。这在计算上昂贵,尽管比单模态双编码器方法更强大。本工作引入一种双编码器图像-文本匹配模型,利用场景图表示标题,其中包含用于对象和属性的节点,这些节点通过关系边相互连接。利用图注意力网络,我们的模型高效地对对象-属性和对象-对象语义关系进行编码, resulting in 一个稳健且快速的性能系统。将标题表示为场景图提供了利用图神经网络强关系归纳偏置的能力,以有效学习对象-属性和对象-对象关系。为了训练模型,我们提出了在整体层面(图像-标题)和局部层面(图像-对象实体)对齐图像和标题的损失函数,这我们表明是模型成功的关键。我们称我们的模型为对象关系和属性组合模型(CORA)。在两个突出的图像-文本检索基准测试(Flickr30K 和 MSCOCO)上的实验结果表明,CORA 在召回分数方面超过了现有实现最先进且计算成本较高的跨注意力方法,同时实现了双编码器的快速计算速度。
引用
@article{arxiv.2406.11820,
title = {Composing Object Relations and Attributes for Image-Text Matching},
author = {Khoi Pham and Chuong Huynh and Ser-Nam Lim and Abhinav Shrivastava},
journal= {arXiv preprint arXiv:2406.11820},
year = {2024}
}
备注
Accepted to CVPR'24