中文

稀疏捷径:高效融合多模态大语言模型中的跨模态知识

计算机视觉与模式识别 2026-02-03 v1 人工智能

摘要

随着大语言模型 (LLM) 在自然语言理解与生成方面的卓越成功,多模态大语言模型 (MLLM) 正在快速进步其处理多模态数据的能力。虽然已有大量工作聚焦于扩大语言模型规模或构建更高质量的训练数据,但对有效将跨模态知识融入语言空间的关注仍有限。在视觉语言模型中,仅使用高层视觉特征进行模态对齐往往会丢弃中间及低层特征中所蕴含的丰富语义信息,限制了模型的跨模态理解能力。为此,我们提出了 SparseCut,这是一种通用的跨模态融合架构,用于 MLLM,引入跨模态编码器与 LLM 之间的稀疏捷径连接。这些捷径连接 enables 在多个层次上高效且层次化地整合视觉特征,以实现更丰富的语义融合,同时不增加计算开销。我们进一步引入一种高效的多粒度特征融合模块,在将特征路由通过捷径之前对视觉特征进行融合。这保留了原始语言上下文,避免增加 LLM 的整体输入长度,从而不增加 LLM 的计算复杂度。实验表明,SparseCut 在各种多模态基准测试中显著提升了 MLLM 的性能,同时在不同基础 LLM 上展现出良好的通用性和可扩展性。

关键词

引用

@article{arxiv.2602.00505,
  title  = {Sparse Shortcuts: Facilitating Efficient Fusion in Multimodal Large Language Models},
  author = {Jingrui Zhang and Feng Liang and Yong Zhang and Wei Wang and Runhao Zeng and Xiping Hu},
  journal= {arXiv preprint arXiv:2602.00505},
  year   = {2026}
}