连接多模态对比表示
机器学习
2023-10-20 v2 人工智能
计算机视觉与模式识别
多媒体
声音
音频与语音处理
摘要
多模态对比表示学习旨在将不同模态编码到一个语义对齐的共享空间中。该范式在跨各种模态的众多下游任务上展现出卓越的泛化能力。然而,对海量高质量数据对的依赖限制了其在更多模态上的进一步发展。本文提出一种无需配对数据、训练高效的 MCR 学习方法,称为连接多模态对比表示(C-MCR)。具体而言,给定两个分别在(A, B)和(B, C)模态对上预训练好的现有 MCR,我们将它们投影到一个新空间,并利用来自重叠模态 B 的数据在新空间中对齐这两个 MCR。同时,由于模态对(A, B)和(B, C)在每个 MCR 内部已经对齐,通过重叠模态学习到的连接也可以迁移到非重叠模态对(A, C)。为释放 C-MCR 的潜力,我们进一步引入一种语义增强的 MCR 间与 MCR 内连接方法。我们首先增强跨不同模态嵌入的语义一致性与完整性,以实现更鲁棒的对齐。然后利用 MCR 间对齐建立连接,并采用 MCR 内对齐更好地维持针对非重叠模态输入的连接。为证明 C-MCR 的有效性,我们通过文本连接 CLIP 和 CLAP 以导出视听表示,并通过图像集成 CLIP 和 ULIP 以得到 3D-语言表示。值得注意的是,在未使用任何配对数据的情况下,C-MCR 的视听版本在音频-图像检索、视听源定位和反事实音频-图像识别任务上取得了最先进性能。此外,C-MCR 的 3D-语言版本在 ModelNet40 上也达到了先进的零样本 3D 点云分类精度。
引用
@article{arxiv.2305.14381,
title = {Connecting Multi-modal Contrastive Representations},
author = {Zehan Wang and Yang Zhao and Xize Cheng and Haifeng Huang and Jiageng Liu and Li Tang and Linjun Li and Yongqi Wang and Aoxiong Yin and Ziang Zhang and Zhou Zhao},
journal= {arXiv preprint arXiv:2305.14381},
year = {2023}
}
备注
NeurIPS 2023