中文

面向跨模态图像-文本检索的对象感知查询扰动

计算机视觉与模式识别 2024-09-26 v2 信息检索 机器学习

摘要

预训练的视觉和语言(V\&L)模型已显著提高了跨模态图像-文本检索的性能。然而,V\&L模型在处理小对象时检索性能有限,这是由于单词与图像中小对象之间的粗糙对齐所致。相反,已知人类认知是以对象为中心的,我们会更关注重要对象,即使它们很小。为弥合人类认知与V\&L模型能力之间的差距,我们提出了基于“对象感知查询扰动”的跨模态图像-文本检索框架。该方法生成检测到的对象的关键特征子空间,并使用该子空间扰动相应的查询,以提高图像中的对象感知能力。在我们的方法中,可以在不额外微调的情况下实现对象感知的跨模态图像-文本检索,同时保持现有V\&L模型的丰富表达能力和检索性能。我们在四个公开数据集上进行了全面实验,结果表明该方法优于传统算法。我们的代码已公开于 \url{https://github.com/NEC-N-SOGI/query-perturbation}。

关键词

引用

@article{arxiv.2407.12346,
  title  = {Object-Aware Query Perturbation for Cross-Modal Image-Text Retrieval},
  author = {Naoya Sogi and Takashi Shibata and Makoto Terao},
  journal= {arXiv preprint arXiv:2407.12346},
  year   = {2024}
}

备注

ECCV 2024. Code: https://github.com/NEC-N-SOGI/query-perturbation