注意鸿沟:理解多模态对比表示学习中的模态鸿沟
计算与语言
2022-10-21 v2 人工智能
计算机视觉与模式识别
机器学习
多媒体
摘要
我们提出模态鸿沟,即多模态模型表示空间中一种引人注目的几何现象。具体而言,我们展示在 CLIP 等多模态模型中,不同数据模态(如图像与文本)在其共享表示中被嵌入于“一臂之遥”。我们的系统分析表明,该鸿沟由模型初始化与对比学习优化共同导致。在模型初始化中,我们从经验与理论上证明,常见深度神经网络的表示受限于狭窄锥体。因此,在具双编码器的多模态模型中,初始化时两模态表示明显分离。在优化期间,对比学习将不同模态保持相隔一定距离,该距离受损失函数中温度参数影响。我们的实验进一步表明,调节模态鸿沟距离对提升模型下游零样本分类性能与公平性有显著影响。我们的代码与数据见 https://modalitygap.readthedocs.io/。
引用
@article{arxiv.2203.02053,
title = {Mind the Gap: Understanding the Modality Gap in Multi-modal Contrastive Representation Learning},
author = {Weixin Liang and Yuhui Zhang and Yongchan Kwon and Serena Yeung and James Zou},
journal= {arXiv preprint arXiv:2203.02053},
year = {2022}
}
备注
Published at NeurIPS 2022. Code and data are available at https://modalitygap.readthedocs.io/