中文

基于视觉主语义保持的图像-文本检索

计算机视觉与模式识别 2023-05-01 v2

摘要

图像-文本检索是跨模态检索的主要任务之一。针对该任务的若干方法将图像和文本映射到一个公共空间以建立两种模态之间的对应关系。然而,由于图像内容的(语义)丰富性,图像中冗余的次要信息可能导致错误匹配。为解决此问题,本文提出一种语义优化方法,实现为视觉语义损失(VSL),以辅助模型聚焦于图像的主要内容。该方法受人们通常通过描述图像主要内容来标注图像内容的方式启发。因此,我们利用与图像对应的标注文本来辅助模型捕捉图像的主要内容,从而减少次要内容的负面影响。在两个基准数据集(MSCOCO 和 Flickr30K)上的大量实验证明了我们方法的优越性能。代码可见于:https://github.com/ZhangXu0963/VSL。

关键词

引用

@article{arxiv.2304.10254,
  title  = {Image-text Retrieval via Preserving Main Semantics of Vision},
  author = {Xu Zhang and Xinzheng Niu and Philippe Fournier-Viger and Xudong Dai},
  journal= {arXiv preprint arXiv:2304.10254},
  year   = {2023}
}

备注

6 pages, 3 figures, accepted by ICME2023