利用冻结单模态编码器进行灵活的多模态对齐
计算机视觉与模式识别
2025-03-25 v2
摘要
最近的对比式多模态视觉语言模型(如 CLIP)已展示出鲁健的开放世界语义理解能力,成为视觉语言应用中标准的图像主干网络。然而,近期研究表明,经过良好训练的单模态编码器之间存在高度语义相似性,这引发了一个关键问题:是否存在可行的方法将单模态主干网络用于视觉语言任务?为此,我们提出了一种新框架,通过冻结单模态编码器进行视觉与语言对齐。该框架涉及从潜在空间中选择语义相似的编码器、构建富有概念内容的图像-文本对数据集,并训练简单的 MLP 投影器。我们在 12 个零样本分类数据集和 2 个图像-文本检索数据集上进行评估。我们的最佳模型采用 DINOv2 和 All-Roberta-Large 文本编码器,在使用从头训练的多模态对齐相比,数据要求降低 20 倍,计算要求降低 65 倍,即可在 ImageNet 上实现 76% 的准确率。该框架提升了多模态模型开发的可及性,同时实现了跨多种场景的灵活适应。代码和精选数据集已在 \texttt{github.com/mayug/freeze-align} 提供。
引用
@article{arxiv.2409.19425,
title = {Harnessing Frozen Unimodal Encoders for Flexible Multimodal Alignment},
author = {Mayug Maniparambil and Raiymbek Akshulakov and Yasser Abdelaziz Dahou Djilali and Sanath Narayan and Ankit Singh and Noel E. O'Connor},
journal= {arXiv preprint arXiv:2409.19425},
year = {2025}
}
备注
Accepted CVPR 2025; First two authors contributed equally;