中文

3SHNet:通过视觉语义-空间自高亮促进图文检索

计算机视觉与模式识别 2024-04-29 v1

摘要

在本文中,我们提出了一种新颖的视觉语义-空间自高亮网络(称为 3SHNet),用于高精度、高效率和高泛化性的图文检索。3SHNet 突出了视觉模态内显著目标及其空间位置的显著识别,从而允许整合视觉语义-空间交互并保持两种模态之间的独立性。这种整合有效地将目标区域与从分割中导出的相应语义和位置布局结合起来,以增强视觉表示。而模态独立性保证了效率和泛化能力。此外,3SHNet 利用来自分割的结构化上下文视觉场景信息来进行局部(基于区域)或全局(基于网格)的引导,并实现准确的混合级检索。在 MS-COCO 和 Flickr30K 基准上进行的大量实验证实,与当代最先进的方法相比,所提出的 3SHNet 具有优越的性能、推理效率和泛化能力。具体而言,在更大的 MS-COCO 5K 测试集上,与使用不同图像表示的最先进方法相比,我们在 rSum 分数上分别实现了 16.3%、24.8% 和 18.3% 的提升,同时保持了最佳的检索效率。此外,我们在跨数据集泛化方面的性能提升了 18.6%。数据和代码可在 https://github.com/XuriGe1995/3SHNet 获取。

关键词

引用

@article{arxiv.2404.17273,
  title  = {3SHNet: Boosting Image-Sentence Retrieval via Visual Semantic-Spatial Self-Highlighting},
  author = {Xuri Ge and Songpei Xu and Fuhai Chen and Jie Wang and Guoxin Wang and Shan An and Joemon M. Jose},
  journal= {arXiv preprint arXiv:2404.17273},
  year   = {2024}
}

备注

Accepted Information Processing and Management (IP&M), 10 pages, 9 figures and 8 tables