English

Beyond Cross-Modal Alignment: Measuring and Leveraging Modality Gap in Vision-Language Models

Computer Vision and Pattern Recognition 2026-04-28 v4 Artificial Intelligence

Abstract

The success of vision-language models is primarily attributed to effective alignment across modalities such as vision and language. However, modality gaps persist in existing alignment algorithms and appear necessary for human perception as evidenced by modality-specific phenomena like visual texture and linguistic tone. These observations motivate us to computationally measure and leverage modality gaps to improve downstream tasks. We first introduce the Modality Dominance Score (MDS), which attributes multimodal features to specific modalities by categorizing them into three classes: vision-dominant features, language-dominant features, and cross-modal features. We then propose automatic interpretability metrics to evaluate these modality-specific features in a scalable manner. Finally, we demonstrate that the training-free model editing enhances multiple downstream tasks, including mitigating bias in gender classification, generating cross-modal adversarial examples, and enabling modality-specific control in text-to-image generation. Combined with task-agnostic interpretability tools, our work offers insights for systematic analysis and lightweight editing of multimodal models.

Keywords

Cite

@article{arxiv.2502.14888,
  title  = {Beyond Cross-Modal Alignment: Measuring and Leveraging Modality Gap in Vision-Language Models},
  author = {Hanqi Yan and Xiangxiang Cui and Lu Yin and Jindong Gu and Paul Pu Liang and Yulan He and Yifei Wang},
  journal= {arXiv preprint arXiv:2502.14888},
  year   = {2026}
}

Comments

accepted by ACL26-findings

R2 v1 2026-06-28T21:51:52.687Z