中文

评估与学习单模态视觉和语言模型的对齐

计算机视觉与模式识别 2025-04-22 v2

摘要

单模态视觉和语言模型的对齐程度如何?尽管已有工作尝试回答这一问题,但它们的评估方法并不能直接转化为这些模型在实际视觉-语言任务中的使用方式。在本文中,我们提出了一种受线性探测启发的直接评估方法,用于评估视觉-语言对齐。我们发现,SSL 视觉模型的对齐程度取决于其 SSL 训练目标,并且 SSL 表示的聚类质量对对齐性能的影响强于其线性可分性。接下来,我们引入 Swift Alignment of Image and Language (SAIL),一个高效的迁移学习框架,用于将预训练的单模态视觉和语言模型对齐到下游视觉-语言任务。由于 SAIL 利用了预训练单模态模型的优势,与从头训练的 CLIP 等模型相比,它仅需显著更少的(6%)配对图像-文本数据即可实现多模态对齐。SAIL 训练仅需一块 A100 GPU、5 小时训练时间,并可容纳高达 32,768 的批量大小。SAIL 在 ImageNet 上达到 73.4% 的零样本准确率(CLIP 为 72.7%),并在零样本检索、复杂推理和语义分割方面表现出色。此外,SAIL 提升了视觉编码器的语言兼容性,进而增强了多模态大语言模型的性能。全部代码和模型权重已开源:https://lezhang7.github.io/sail.github.io/

关键词

引用

@article{arxiv.2412.04616,
  title  = {Assessing and Learning Alignment of Unimodal Vision and Language Models},
  author = {Le Zhang and Qian Yang and Aishwarya Agrawal},
  journal= {arXiv preprint arXiv:2412.04616},
  year   = {2025}
}

备注

CVPR 2025 Highlight