中文

面向含噪标签跨模态检索的统一最优传输框架

计算机视觉与模式识别 2024-10-27 v1 信息检索 多媒体

摘要

跨模态检索旨在建立不同模态之间的交互,其中监督式跨模态检索因其在学习语义类别区分方面的灵活性而日益兴起。尽管以往的监督式跨模态检索方法取得了显著性能,但其成功很大程度上归功于良好标注的数据。然而,即使对于单模态数据,精确标注也昂贵且耗时,在多模态场景下则更具挑战性。实践中,大量多模态数据是从互联网上收集的,带有粗略标注,这不可避免地引入了噪声标签。使用此类误导性标签进行训练会带来两个关键挑战——强制多模态样本对齐不正确的语义并扩大异质性差距,导致检索性能不佳。为应对这些挑战,本文提出了UOT-RCL,一个基于最优传输的鲁棒跨模态检索统一框架。首先,我们提出了一种基于部分最优传输的语义对齐方法,以逐步纠正噪声标签,其中设计了一种新颖的跨模态一致代价函数来融合不同模态并提供精确的传输代价。其次,为缩小多模态数据中的差异,提出了一种基于最优传输的关系对齐方法,以推断语义级别的跨模态匹配。这两个组成部分都利用多模态数据之间的内在相关性来促进有效的代价函数。在三个广泛使用的跨模态检索数据集上的实验表明,我们的UOT-RCL超越了最先进的方法,并显著提高了对噪声标签的鲁棒性。

关键词

引用

@article{arxiv.2403.13480,
  title  = {A Unified Optimal Transport Framework for Cross-Modal Retrieval with Noisy Labels},
  author = {Haochen Han and Minnan Luo and Huan Liu and Fang Nan},
  journal= {arXiv preprint arXiv:2403.13480},
  year   = {2024}
}

备注

This work has been submitted to the IEEE for possible publication