Synergy-CLIP:通过多模态集成扩展 CLIP 以实现稳健表征学习
机器学习
2025-05-01 v1
摘要
多模态表征学习已成为人工智能中的关键领域,使能够整合视觉、文本和音频等多种模态以解决复杂问题。然而,现有方法主要关注双模态交互,如图像-文本对,这限制了其完全发挥多模态数据丰富性的能力。此外,等比例环境中模态的集成仍未得到充分探索,这源于构建大规模、平衡数据集的挑战。本研究提出了 Synergy-CLIP,一种新型框架,将对比语言-图像预训练 (CLIP) 架构扩展,以增强多模态表征学习,通过整合视觉、文本和音频三个模态。不同于专注于调整单个模态以适应 vanilla-CLIP 的现有方法,Synergy-CLIP 在三个模态之间进行对齐和捕获潜在信息。为解决构建大规模多模态数据集的高成本问题,我们引入了 VGG-sound+,一个为视觉、文本和音频数据提供等比例表示的三模态数据集。Synergy-CLIP 在各种下游任务上进行验证,包括零样本分类,在这些任务中它超越了现有基准。此外,我们引入了缺失模态重建任务,表明 Synergy-CLIP 能够在真实应用场景中从模态之间提取协同效应。这些贡献为推动多模态表征学习并探索新的研究方向提供了稳健的基础。
引用
@article{arxiv.2504.21375,
title = {Synergy-CLIP: Extending CLIP with Multi-modal Integration for Robust Representation Learning},
author = {Sangyeon Cho and Jangyeong Jeon and Mingi Kim and Junyeong Kim},
journal= {arXiv preprint arXiv:2504.21375},
year = {2025}
}
备注
Multi-modal, Multi-modal Representation Learning, Missing Modality, Missing Modality Reconstruction, Speech and Multi-modality, Vision and Language