中文

单体视觉语言模型的综合视觉语言嵌入:HoVLE

计算机视觉与模式识别 2025-02-11 v2

摘要

大型语言模型(LLM)的快速发展催化了视觉语言模型(VLM)的发展。单体 VLM 避免了模态特定编码器,为构式 VLM 提供了有前景的替代方案,但面临性能不佳的挑战。大多数现有的单体 VLM 需要对预训练的 LLM 进行调优以获取视觉能力,而这可能削弱其语言能力。为此,本文提出一种新型高性能单体 VLM,命名为 HoVLE。我们注意到,LLM 已被证明在图像嵌入与文本嵌入对齐时具有图像解释能力。当前单体 VLM 的实际挑战在于缺乏用于处理视觉和语言输入的整体嵌入模块。因此,HoVLE 引入了一个整体嵌入模块,将视觉和文本输入转换为共享空间,使 LLM 能够以与处理文本相同的方式处理图像。此外, carefully 设计了多阶段训练策略以赋能整体嵌入模块。首先,它通过从预训练视觉编码器提取视觉特征和 LLM 提取的文本嵌入来进行蒸馏,使其能够在大规模无配对随机图像和文本标记上进行训练。整个模型进一步在多模态数据上进行 next-token 预测,以对齐嵌入。最后,加入指令微调阶段。我们的实验表明,HoVLE 在各种基准测试上的性能接近领先的构式模型,显著优于以前的单体模型。模型已在 https://huggingface.co/OpenGVLab/HoVLE 上提供。

关键词

引用

@article{arxiv.2412.16158,
  title  = {HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding},
  author = {Chenxin Tao and Shiqian Su and Xizhou Zhu and Chenyu Zhang and Zhe Chen and Jiawen Liu and Wenhai Wang and Lewei Lu and Gao Huang and Yu Qiao and Jifeng Dai},
  journal= {arXiv preprint arXiv:2412.16158},
  year   = {2025}
}