FlowMM:基于跨模态信息流引导的 KV 缓存合并用于高效多模态上下文推理
计算与语言
2025-11-14 v2
摘要
传统的 KV 缓存驱逐策略会根据注意力得分丢弃不太关键的 KV 配对,常导致生成质量下降,引起上下文丢失或幻觉。近期研究转向 KV 合并,基于相似度将驱逐 token 与保留 token 合并。然而,在多模态场景中,跨模态 token 之间的分布偏差以及跨模态交互中的注意力偏差限制了其有效性。本工作提出 FlowMM,一个基于跨模态信息流引导的自适应多模态 KV 缓存合并框架。FlowMM 利用跨模态信息流动态应用特定于层级的合并策略,捕获模态特定模式,同时保持上下文完整性。此外,我们引入一种灵敏度自适应 token 匹配机制,联合评估 token 相似度和任务关键性灵敏度,在保留高灵敏度 token 的同时合并低风险 token。广泛实验表明,FlowMM 在 diverse MLLMs 上将 KV 缓存内存减少 80%至95%,解码延迟降低 1.3至1.8倍,同时保持竞争的任务性能。
引用
@article{arxiv.2511.05534,
title = {FlowMM: Cross-Modal Information Flow Guided KV Cache Merging for Efficient Multimodal Context Inference},
author = {Kunxi Li and Yufan Xiong and Zhonghua Jiang and Yiyun Zhou and Zhaode Wang and Chengfei Lv and Shengyu Zhang},
journal= {arXiv preprint arXiv:2511.05534},
year = {2025}
}