模态间隙是错误还是功能?从鲁棒性视角审视
计算机视觉与模式识别
2026-04-29 v2 机器学习
摘要
许多现代多模态模型(如CLIP)寻求构建一种嵌入空间,使两种模态对齐。令人惊讶的是,几乎所有现有模型都显示出强烈的模态间隙:图像分布与文本分布在共享嵌入空间中呈现明显分离。尽管近期已有多篇论文讨论此问题,但至今仍不清楚间隙存在的原因,以及闭合间隙(post-processing)是否能提升下游任务性能。本文表明,在特定条件下,对对比损失最小化可得到一种表示:两种模态被一个与其嵌入正交的全局间隙向量分隔。我们也表明,在这些条件下,模态间隙与鲁棒性单调相关:缩小间隙不会改变干净准确性,却降低模型在嵌入被扰动时改变输出的概率。我们的实验表明,对于许多真实世界的视觉语言模型(VLMs),通过简单的后处理步骤将一种模态移动到另一种模态的均值,即可显著提升鲁棒性,而不会损失干净准确性。
引用
@article{arxiv.2603.29080,
title = {Is the Modality Gap a Bug or a Feature? A Robustness Perspective},
author = {Rhea Chowers and Oshri Naparstek and Udi Barzelay and Yair Weiss},
journal= {arXiv preprint arXiv:2603.29080},
year = {2026}
}