中文

MXM-CLR:一种用于多模态多重建表示对比学习的统一框架

计算机视觉与模式识别 2023-03-22 v2

摘要

不同数据模态的多重观测十分常见,例如一个三维形状可由多视角图像表示,一幅图像可由不同描述文本刻画。现有的跨模态对比表示学习(XM-CLR)方法(如 CLIP)并不完全适用于多重数据,因为它们在计算对比损失时仅考虑一个正样本对并将其他对视为负样本。本文提出 MXM-CLR,一种用于多模态多重建表示对比学习的统一框架。MXM-CLR 显式建模并学习来自不同模态的实例的多重观测之间的关系,以实现更全面的表示学习。MXM-CLR 的核心是一种新颖的多重感知混合损失,其在计算跨模态数据对的硬关系和软关系时考虑多个正观测。我们在 Text2Shape 和 Flickr30K 数据集上针对跨模态检索任务与 SOTA 基线进行了定量与定性比较。我们还对 MXM-CLR 的适应性与泛化性进行了广泛评估,并对损失设计和批大小的影响进行了消融研究。结果表明 MXM-CLR 在学习多重数据更好的表示方面具有优越性。代码见 https://github.com/JLU-ICL/MXM-CLR。

关键词

引用

@article{arxiv.2303.10839,
  title  = {MXM-CLR: A Unified Framework for Contrastive Learning of Multifold Cross-Modal Representations},
  author = {Ye Wang and Bowei Jiang and Changqing Zou and Rui Ma},
  journal= {arXiv preprint arXiv:2303.10839},
  year   = {2023}
}

备注

16 pages, 14 figures