中文

扩展多模态对比表示

计算机视觉与模式识别 2023-10-16 v1

摘要

多于三种模态的多模态对比表示(MCR)在多模态学习中至关重要。尽管近期方法展现出令人印象深刻的成果,其对大规模、高质量配对数据的高度依赖以及高昂的训练成本限制了它们的进一步发展。受近期 C-MCR 启发,本文提出扩展多模态对比表示(Ex-MCR),一种训练高效且无需配对数据的方法,通过整合现有 MCR 空间的知识,灵活地学习多于三种模态的统一对比表示空间。具体而言,Ex-MCR 将多个现有 MCR 对齐到同一基础 MCR 中,从而有效保留基础 MCR 原有的语义对齐。此外,我们从训练数据、架构和学习目标的角度全面增强了用于对齐 MCR 空间的整个学习流程。借助保留的原始模态对齐与增强的空间对齐,Ex-MCR 展现出优越的表示学习性能和出色的模态可扩展性。为证明 Ex-MCR 的有效性,我们分别利用重叠的文本和图像模态,将 CLAP(音频-文本)和 ULIP(3D-视觉)的 MCR 空间对齐到 CLIP(视觉-文本)中。值得注意的是,在不使用任何配对数据的情况下,Ex-MCR 学习到了 3D-图像-文本-音频统一对比表示,并在音频-视觉、3D-图像、音频-文本、视觉-文本检索以及 3D 物体分类任务上取得了最先进的性能。更重要的是,大量定性结果进一步展示了扩展模态(如音频与 3D)之间涌现的语义对齐,凸显了模态可扩展性的巨大潜力。

关键词

引用

@article{arxiv.2310.08884,
  title  = {Extending Multi-modal Contrastive Representations},
  author = {Zehan Wang and Ziang Zhang and Luping Liu and Yang Zhao and Haifeng Huang and Tao Jin and Zhou Zhao},
  journal= {arXiv preprint arXiv:2310.08884},
  year   = {2023}
}

备注

Our code is available at https://github.com/MCR-PEFT/Ex-MCR