中文

VLMs 深度预对齐

计算机视觉与模式识别 2026-05-18 v1

摘要

大多数视觉-语言模型(VLMs)直接将 ViT 编码器的输出映射到 LLM,通过轻量级投影器。虽然有效,但最近的分析表明,这种架构存在对齐挑战:视觉特征在 LLM 初始层面仍保持距离文本空间,迫使模型在处理浅层模态对齐而非深层理解和复杂推理时浪费关键深度资源。本文提出一种深度预对齐(Deep Pre-Alignment, DPA)方法,取代标准 ViT 编码器,采用小型 VLM 作为感知器,确保视觉特征与目标大型语言模型的文本空间深度对齐。全面实验表明,DPA 的有效性。在 4B 参数规模上,DPA 在 8 个多模态基准测试中均优于基线方法,提升幅度在 32B 规模时扩大至 3.0 分。此外,DPA 通过将对齐工作卸载至感知器,实现了在 3 个文本基准测试中约 32.9% 的语言能力遗忘率降低。我们进一步表明,这些收益在包括 Qwen3 和 LLaMA 3.2 在内的不同 LLM 家族中保持一致,凸显了该方法的普适性。除性能外,DPA 还为当前 VLM 开发提供了无缝升级路径,只需以模块化方式替换视觉编码器,即可实现边缘计算开销的轻微增加。

关键词

引用

@article{arxiv.2605.15300,
  title  = {Deep Pre-Alignment for VLMs},
  author = {Tianyu Yu and Kechen Fang and Zihao Wan and Kaidong Zhang and Yicheng Zhang and Jun Song and Bo Zheng and Yuan Yao},
  journal= {arXiv preprint arXiv:2605.15300},
  year   = {2026}
}

备注

Accepted by ICML 2026. Project Website: https://github.com/THUMAI-Lab/Deep-Pre-Alignment