中文

LinMU:线性复杂度的多模态理解

计算机视觉与模式识别 2026-05-05 v2 人工智能 机器学习 多媒体 图像与视频处理

摘要

现代视觉语言模型(VLM)取得了令人印象深刻的性能,但受限于自注意力的二次复杂度,这使得它们无法在边缘设备上部署,也使得它们对高分辨率图像和长时长视频的理解变得代价高昂。为解决这一挑战,我们提出了 LinMU(Linear-complexity Multimodal Understanding),这是一种 VLM 设计,实现了语言模型解码器的线性复杂度,且不使用任何二次复杂度模块,同时保持了全局注意力 VLM 的性能。LinMU 将语言模型解码器中的每个自注意力层替换为 M-MATE 模块:一个双支路模块,将用于全局上下文的 Flex-MA 分支(基于状态空间模型)与用于相邻相关性的局部 Swin 风格窗口注意力(Local-Swin 分支)相结合。要将预训练的 VLM 转换为 LinMU 架构,我们提出了三阶段蒸馏框架:(i)初始化两个支路并仅训练 Flex-MA 分支,(ii)解冻 Local-Swin 分支并与 Flex-MA 分支联合微调,(iii)解冻剩余模块并使用 LoRA 适配器进行微调,同时对 frozen VLM 教师的隐藏状态和 token 级别的 logits 进行回归。在 MMMU、TextVQA、LongVideoBench、Video-MME 等基准测试上,LinMU 匹配了教师模型的性能,但在分钟长度视频上将首次token延迟(TTFT)缩短最高可达 2.7 倍,提高了代币吞吐量最高可达 9.0 倍。消融实验确认了每个蒸馏阶段以及 M-MATE 模块两个支路的重要性。该框架表明,在不采用二次注意力的情况下仍可实现最先进的多模态推理,从而为处理高分辨率图像和长视频的长上下文 VLM 开辟了新途径。

关键词

引用

@article{arxiv.2601.01322,
  title  = {LinMU: Multimodal Understanding Made Linear},
  author = {Hongjie Wang and Niraj K. Jha},
  journal= {arXiv preprint arXiv:2601.01322},
  year   = {2026}
}

备注

Published in Transactions on Machine Learning Research