从一对一到多对多:用于深度视觉-语言融合的动态跨层注入
计算机视觉与模式识别
2026-01-16 v1
摘要
视觉-语言模型(VLMs)通过使用粗糙的、非对称的连接(仅将视觉编码器的输出链接到大语言模型(LLM)的输入)造成了严重的视觉特征瓶颈。这种静态架构从根本上限制了 LLMs 实现与分层视觉知识全面对齐的能力,损害了其将局部细节与全局语义准确整合为连贯推理的能力。为解决此问题,我们引入了跨层注入(CLI),一种新颖且轻量级的框架,在两种模态之间构建动态的多对多桥梁。CLI 由两个协同的、参数高效的组件组成:一个自适应多投影(AMP)模块,用于协调来自不同视觉层的特征;以及一个自适应门控融合(AGF)机制,使 LLM 能够根据其实时解码上下文选择性地注入最相关的视觉信息。我们通过将 CLI 集成到 LLaVA-OneVision 和 LLaVA-1.5 中来验证其有效性和通用性。在 18 个多样化基准上的大量实验表明了显著的性能提升,确立了 CLI 作为一种可扩展范式,通过赋予 LLMs 按需访问完整视觉层次结构的能力,解锁了更深层次的多模态理解。
引用
@article{arxiv.2601.10710,
title = {From One-to-One to Many-to-Many: Dynamic Cross-Layer Injection for Deep Vision-Language Fusion},
author = {Cheng Chen and Yuyu Guo and Pengpeng Zeng and Jingkuan Song and Peng Di and Hang Yu and Lianli Gao},
journal= {arXiv preprint arXiv:2601.10710},
year = {2026}
}