学习重匹配错配对以实现鲁棒的跨模态检索
计算机视觉与模式识别
2024-03-11 v1 人工智能
多媒体
摘要
收集匹配良好的多模态数据集对于训练跨模态检索模型至关重要。然而,在现实场景中,海量多模态数据是从互联网采集的,其中不可避免地包含部分错配对(Partially Mismatched Pairs, PMPs)。毫无疑问,此类语义无关的数据将显著损害跨模态检索性能。以往的努力倾向于通过估计软对应关系来降低 PMPs 的贡献,从而缓解这一问题。在本文中,我们旨在从一个新的视角应对这一挑战:未配对样本之间潜在的语义相似性使得从错配对中挖掘有用知识成为可能。为此,我们提出了 L2RM,一种基于最优传输(Optimal Transport, OT)的通用框架,旨在学习重匹配错配对。具体而言,L2RM 旨在通过寻求跨不同模态的最小成本传输计划来生成细化的对齐。为了在 OT 中形式化重匹配思想,首先,我们提出了一种自监督成本函数,该函数能自动从显式的相似性 - 成本映射关系中学习。其次,我们提出对部分 OT 问题进行建模,同时限制假阳性之间的传输,以进一步提升细化对齐的效果。在三个基准测试上的大量实验表明,我们的 L2RM 显著提高了现有模型针对 PMPs 的鲁棒性。代码地址:https://github.com/hhc1997/L2RM。
引用
@article{arxiv.2403.05105,
title = {Learning to Rematch Mismatched Pairs for Robust Cross-Modal Retrieval},
author = {Haochen Han and Qinghua Zheng and Guang Dai and Minnan Luo and Jingdong Wang},
journal= {arXiv preprint arXiv:2403.05105},
year = {2024}
}
备注
CVPR 2024