中文

用于跨模态检索的深度可逆一致性学习

计算机视觉与模式识别 2025-01-13 v1 多媒体

摘要

跨模态检索通常涉及学习公共表示,以直接测量多模态样本之间的相似性。大多数现有的跨模态检索方法通常假设多模态样本成对出现,并采用联合训练来学习公共表示,这限制了跨模态检索的灵活性。尽管一些方法为每种模态采用独立训练策略以提高跨模态检索的灵活性,但它们利用随机初始化的正交矩阵来指导表示学习,这是次优的,因为它们假设类间样本彼此独立,限制了样本表示与真实标签之间语义对齐的潜力。为了解决这些问题,我们提出了一种用于跨模态检索的新方法,称为深度可逆一致性学习。DRCL 包含两个核心模块,即选择性先验学习和可逆语义一致性学习。具体而言,SPL 首先在每种模态上学习一个变换权重矩阵,并根据质量分数选择最佳的一个作为先验,这极大地避免了对从低质量模态中学习到的先验的盲目选择。然后,RSC 采用模态不变表示重铸机制,利用先验的广义逆矩阵从样本语义标签中重铸潜在的模态不变表示。由于标签不包含特定于模态的信息,我们利用重铸特征来指导表示学习,从而在最大程度上保持语义一致性。此外,RSC 中引入了特征增强机制,以鼓励模型在更广泛的数据分布上进行学习,以增加多样性。最后,在五个广泛使用的数据集上进行的广泛实验以及与 15 个最先进基线的比较证明了我们 DRCL 的有效性和优越性。

关键词

引用

@article{arxiv.2501.05686,
  title  = {Deep Reversible Consistency Learning for Cross-modal Retrieval},
  author = {Ruitao Pu and Yang Qin and Dezhong Peng and Xiaomin Song and Huiming Zheng},
  journal= {arXiv preprint arXiv:2501.05686},
  year   = {2025}
}