AccKV:面向高效音视频大语言模型推理的自适应聚焦与跨标定 KV 缓存优化
多媒体
2025-11-17 v1 计算机视觉与模式识别
声音
摘要
近期音视频大语言模型(AV-LLMs)的快速发展提升了其在音视频问答和多模态对话系统等任务中的能力。视频和音频引入了扩展的时间维度,导致键值(KV)缓存相对于静态图像嵌入更大。 naive 的优化策略是根据任务选择性地聚焦并保留音频或视频的 KV 缓存。然而,在实验中,我们发现 AV-LLMs 对不同模态在高层的注意力并非严格依赖于任务。在较高的层次上,AV-LLMs 对视频模态的注意力更集中。此外,我们还发现,直接整合音频的时序 KV 缓存和视频的时空 KV 缓存可能导致信息混淆,并显著降低 AV-LLMs 的性能。如果对音视频进行不加区分的处理,可能导致某一模态的过度压缩或保留,从而破坏模态之间的对齐。为此,我们提出了 AccKV,一个为高效 AV-LLMs 推理设计的自适应聚焦与跨标定 KV 缓存优化框架。该方法基于层级自适应聚焦技术,根据不同层的特性有针对性地聚焦关键模态,并通过注意力重新分配来增强对重点 token 的识别。此外,我们提出了跨标定技术,首先整合音频和视频模态内部的低效 KV 缓存,然后将低优先级模态与高优先级模态对齐,以选择性地驱逐低优先级模态的 KV 缓存。实验结果表明,AccKV 能在保持准确性的同时显著提升 AV-LLMs 的计算效率。
引用
@article{arxiv.2511.11106,
title = {AccKV: Towards Efficient Audio-Video LLMs Inference via Adaptive-Focusing and Cross-Calibration KV Cache Optimization},
author = {Zhonghua Jiang and Kui Chen and Kunxi Li and Keting Yin and Yiyun Zhou and Zhaode Wang and Chengfei Lv and Shengyu Zhang},
journal= {arXiv preprint arXiv:2511.11106},
year = {2025}
}