MEDA:面向高效多模态长上下文推理的动态 KV 缓存分配
计算与语言
2025-03-14 v2
摘要
结合了长文本-图像和文本-视频模态的长上下文多模态大型语言模型(MLLMs),随着输入长度的增加,其多模态键值(KV)缓存不断增长,需要消耗大量资源,对推理效率构成了挑战。现有的纯文本和多模态 LLM 的 KV 缓存压缩方法忽略了各层之间注意力密度的变化,因此通常采用均匀或渐进式的缩减策略来进行逐层缓存分配。在这项工作中,我们提出了 MEDA,一种用于高效多模态长上下文推理的动态逐层 KV 缓存分配方法。作为核心,MEDA 利用跨模态注意力熵来确定 MLLMs 每一层的 KV 缓存大小。鉴于每一层动态分配的 KV 缓存大小,MEDA 还采用了一种 KV 对选择方案来确定选择哪些 KV 对,并采用了一种 KV 对合并策略,将选中和未选中的 KV 对进行合并,以保留来自整个上下文的信息。MEDA 实现了高达 72% 的 KV 缓存内存减少和 2.82 倍的解码速度提升,同时在长上下文设置下的各种多模态任务(包括多图像和长视频场景)中保持或提升了性能。我们的代码已在 https://github.com/AIoT-MLSys-Lab/MEDA 发布。
引用
@article{arxiv.2502.17599,
title = {MEDA: Dynamic KV Cache Allocation for Efficient Multimodal Long-Context Inference},
author = {Zhongwei Wan and Hui Shen and Xin Wang and Che Liu and Zheda Mai and Mi Zhang},
journal= {arXiv preprint arXiv:2502.17599},
year = {2025}
}
备注
NAACL 2025 Main