中文

MMInference:基于模态感知置换稀疏注意力加速长上下文 VLM 的前填充

计算机视觉与模式识别 2025-05-26 v2 机器学习

摘要

将长上下文能力与视觉理解能力集成为视觉语言模型 (VLM) 带来了前所未有的潜力。然而,预填充阶段的二次注意力复杂度仍是实际部署的重大障碍。为克服这一限制,我们引入 MMInference (Multimodality Million tokens Inference),一种动态稀疏注意力方法,用于加速长上下文多模态输入的前填充。首先,我们的分析揭示了视频输入的时间和空间局部性导致独特稀疏模式,即网格模式。同时,VLM 在不同模态之间表现出显著不同的稀疏分布。我们引入一种置换方法以利用独特的网格模式并处理模态边界问题。通过离线搜索每个注意力头的最优稀疏模式,MMInference 根据输入动态构建稀疏分布。我们还提供了优化的 GPU 内核以实现高效稀疏计算。值得注意的是,MMInference 可无缝集成到现有 VLM 管道中,无需任何模型修改或微调。在多模态基准测试中,包括 Video QA、Captioning、VisionNIAH 和 Mixed-Modality NIAH,使用最先进的长上下文 VLM (LongVila、LlavaVideo、VideoChat-Flash、Qwen2.5-VL) 的实验表明,MMInference 在 1M tokens 时可将前填充速度提升最高达 8.3 倍,同时保持准确率。我们的代码已公开:https://aka.ms/MMInference

关键词

引用

@article{arxiv.2504.16083,
  title  = {MMInference: Accelerating Pre-filling for Long-Context VLMs via Modality-Aware Permutation Sparse Attention},
  author = {Yucheng Li and Huiqiang Jiang and Chengruidong Zhang and Qianhui Wu and Xufang Luo and Surin Ahn and Amir H. Abdi and Dongsheng Li and Jianfeng Gao and Yuqing Yang and Lili Qiu},
  journal= {arXiv preprint arXiv:2504.16083},
  year   = {2025}
}

备注

Accepted at ICML 2025