LangBridge:将图像诠释为语言嵌入的组合
计算机视觉与模式识别
2025-11-11 v3
摘要
近年来,大型视觉-语言模型 (LVLM) 取得了显著进展,已在多种复杂的视觉-语言任务上达到人类水平。沿用 LLaVA 的范式,主流 LVLM 通常采用浅层 MLP,通过两阶段训练过程实现视觉-语言对齐:先进行跨模态对齐的预训练,再进行指令微调。尽管该方法已被证明有效,但 MLP 如何弥合模态差距的内在机制仍不清楚。虽然已有研究探讨了 LLM 如何处理变换后的视觉标记,但鲜有研究考察其基本的对齐机制。此外,MLP 适配器在切换 LLM 主干网络时需要重新训练。为克服这些局限,我们首先研究了 MLP 适配器的工作原理,发现其逐步学习将视觉嵌入投影到对应文本嵌入所张成的子空间中。基于这一洞见,我们提出了 LangBridge,一种新颖的适配器,显式地将视觉标记映射为 LLM 词表嵌入的线性组合。这一创新设计使得适配器可在不同 LLM 间无需预训练地迁移,同时保持性能。实验结果表明,在 Qwen2-0.5B 上预训练的 LangBridge 适配器可直接应用于 LLaMA3-8B 或 Qwen2.5-14B 等更大模型,并保持具有竞争力的性能。总体而言,LangBridge 通过将视觉表征锚定于 LLM 词嵌入,实现了可解释的视觉-语言对齐;其即插即用设计确保了在多个 LLM 间的高效复用,且几乎无性能下降。项目页面见 https://curryx-001.github.io/LangBridge.github.io/
引用
@article{arxiv.2503.19404,
title = {LangBridge: Interpreting Image as a Combination of Language Embeddings},
author = {Jiaqi Liao and Yuwei Niu and Fanqing Meng and Hao Li and Changyao Tian and Yinuo Du and Yuwen Xiong and Dianqi Li and Xizhou Zhu and Li Yuan and Jifeng Dai and Yu Cheng},
journal= {arXiv preprint arXiv:2503.19404},
year = {2025}
}
备注
The code and weights are open-sourced. Project page: https://curryx-001.github.io/LangBridge.github.io/