中文

用于图文检索的跨模态与单模态软标签对齐

计算机视觉与模式识别 2024-03-29 v1 多媒体

摘要

当前的图文检索方法近年来已展现出令人印象深刻的性能。然而,它们仍面临两个问题:模间匹配缺失问题和模内语义丢失问题。这些问题会显著影响图文检索的准确性。为了解决这些挑战,我们提出了一种名为跨模态与单模态软标签对齐 (CUSA) 的新方法。我们的方法利用单模态预训练模型的能力,为图文检索模型提供软标签监督信号。此外,我们引入了两种对齐技术,即跨模态软标签对齐 (CSA) 和单模态软标签对齐 (USA),以克服假阴性问题并增强单模态样本之间的相似度识别。我们的方法设计为即插即用,意味着可以轻松应用于现有的图文检索模型而无需改变其原始架构。在各种图文检索模型和数据集上的大量实验表明,我们的方法可以持续提高图文检索的性能并取得新的最先进结果。此外,我们的方法还能提升图文检索模型的单模态检索性能,使其能够实现通用检索。代码和补充材料可在 https://github.com/lerogo/aaai24_itr_cusa 找到。

关键词

引用

@article{arxiv.2403.05261,
  title  = {Cross-Modal and Uni-Modal Soft-Label Alignment for Image-Text Retrieval},
  author = {Hailang Huang and Zhijie Nie and Ziqiao Wang and Ziyu Shang},
  journal= {arXiv preprint arXiv:2403.05261},
  year   = {2024}
}

备注

9 pages, Accepted by AAAI2024