中文

利用冻结单模态编码器进行灵活的多模态对齐

计算机视觉与模式识别 2025-03-25 v2

摘要

最近的对比式多模态视觉语言模型(如 CLIP)已展示出鲁健的开放世界语义理解能力,成为视觉语言应用中标准的图像主干网络。然而,近期研究表明,经过良好训练的单模态编码器之间存在高度语义相似性,这引发了一个关键问题:是否存在可行的方法将单模态主干网络用于视觉语言任务?为此,我们提出了一种新框架,通过冻结单模态编码器进行视觉与语言对齐。该框架涉及从潜在空间中选择语义相似的编码器、构建富有概念内容的图像-文本对数据集,并训练简单的 MLP 投影器。我们在 12 个零样本分类数据集和 2 个图像-文本检索数据集上进行评估。我们的最佳模型采用 DINOv2 和 All-Roberta-Large 文本编码器,在使用从头训练的多模态对齐相比,数据要求降低 20 倍,计算要求降低 65 倍,即可在 ImageNet 上实现 76% 的准确率。该框架提升了多模态模型开发的可及性,同时实现了跨多种场景的灵活适应。代码和精选数据集已在 \texttt{github.com/mayug/freeze-align} 提供。

关键词

引用

@article{arxiv.2409.19425,
  title  = {Harnessing Frozen Unimodal Encoders for Flexible Multimodal Alignment},
  author = {Mayug Maniparambil and Raiymbek Akshulakov and Yasser Abdelaziz Dahou Djilali and Sanath Narayan and Ankit Singh and Noel E. O'Connor},
  journal= {arXiv preprint arXiv:2409.19425},
  year   = {2025}
}

备注

Accepted CVPR 2025; First two authors contributed equally;