基于场景图融合网络的图像-文本检索
计算机视觉与模式识别
2023-03-21 v1 人工智能
摘要
图像-文本检索的一个关键挑战是如何学习图像与文本间的准确对应关系。大多数现有方法主要关注基于语义对象共现的粗粒度对应,却无法区分细粒度局部对应。本文提出一种新颖的基于场景图的融合网络(称为 SGFN),其通过模态内与跨模态融合来增强图像/文本特征以用于图像-文本检索。具体而言,我们设计了模态内层次注意力融合,通过场景图将对象、属性与关系等语义上下文融入图像/文本特征向量,以及跨模态注意力融合,通过上下文向量将上下文语义与局部融合相结合。在公开数据集 Flickr30K 与 MSCOCO 上的大量实验表明,我们的 SGFN 优于不少 SOTA 图像-文本检索方法。
引用
@article{arxiv.2303.11090,
title = {Scene Graph Based Fusion Network For Image-Text Retrieval},
author = {Guoliang Wang and Yanlei Shang and Yong Chen},
journal= {arXiv preprint arXiv:2303.11090},
year = {2023}
}