中文

MHA2MLA-VLM:在视觉-语言模型中启用 DeepSeek 的经济型多头潜在注意力

计算机视觉与模式识别 2026-01-19 v1 人工智能 计算与语言 机器学习

摘要

随着视觉-语言模型处理日益复杂的多模态任务,Key-Value (KV) 缓存的快速增长在推理过程中造成了显著的内存和计算瓶颈。虽然多头潜在注意力提供了一种压缩 KV 缓存并加速推理的有效手段,但在无需高昂预训练成本的情况下将现有 VLM 适配至 MLA 架构仍 largely 未被探索。在本工作中,我们提出了 MHA2MLA-VLM,一个用于将现成 VLM 转换为 MLA 的参数高效且多模态感知的框架。我们的方法包含两项核心技术:(1) 模态自适应部分 RoPE 策略,通过选择性屏蔽非必要维度来同时支持传统和多模态设置;(2) 模态解耦低秩近似方法,独立压缩视觉和文本 KV 空间。此外,我们引入参数高效微调以最小化适配成本,并证明最小化输出激活误差而非参数距离能大幅降低性能损失。在三个代表性 VLM 上的大量实验表明,MHA2MLA-VLM 能以极少的监督数据恢复原始模型性能,显著减少 KV 缓存占用,并无缝集成 KV 量化。

关键词

引用

@article{arxiv.2601.11464,
  title  = {MHA2MLA-VLM: Enabling DeepSeek's Economical Multi-Head Latent Attention across Vision-Language Models},
  author = {Xiaoran Fan and Zhichao Sun and Tao Ji and Lixing Shen and Tao Gui},
  journal= {arXiv preprint arXiv:2601.11464},
  year   = {2026}
}