基于核的无监督嵌入对齐以增强视觉语言模型中的视觉表示
计算机视觉与模式识别
2025-06-04 v1
摘要
视觉语言模型(如 CLIP)在视觉和文本表示对齐方面取得了显著成功,成为 LLaVA 和 OpenFlamingo 等多模态大语言模型(MLLM)的重要组成部分。然而,大量研究指出 CLIP 在细粒度感知方面的局限性是一个关键缺陷,导致下游 MLLM 出现严重失败。相比之下,以视觉为中心的基础模型(如 DINOv2)在从图像中捕捉精细细节方面展现出卓越能力。在这项工作中,我们提出了一种新颖的基于核的方法,将 CLIP 的视觉表示与 DINOv2 的视觉表示进行对齐,确保生成的嵌入在保持与文本嵌入兼容的同时增强感知能力。我们的对齐目标专为高效的随机优化而设计。经过这种仅图像的对齐微调后,视觉编码器保持了与冻结文本编码器的兼容性,并在零样本目标识别、细粒度空间推理和定位方面展现出显著改进。通过集成对齐后的视觉编码器,下游 MLLM 也表现出增强的性能。
引用
@article{arxiv.2506.02557,
title = {Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models},
author = {Shizhan Gong and Yankai Jiang and Qi Dou and Farzan Farnia},
journal= {arXiv preprint arXiv:2506.02557},
year = {2025}
}
备注
ICML 2025