中文

面向高效视觉语言模型推理的旋转对齐关键通道剪枝

计算机视觉与模式识别 2026-05-20 v1 人工智能

摘要

视觉语言模型在推理时常因 KV 缓存压力问题严重,因为单张图像常编码为数千个 token。现有方法大多通过 token 稀疏化来削减 token 数,但永久性丢弃视觉内容会导致细粒度感知任务出现显著性能下降。由此催生了另一条补充路径:特征稀疏化。在固定 KV 缓存预算下,压缩通道维度可在相同内存成本下保留更多视觉 token。然而,现有的关键通道剪枝方法面临结构性权衡:基于 token 的通道剪枝虽具表达力但非结构化且运行缓慢,而基于头的方法则硬件友好但鲁棒性较差。我们提出 RotateK,通过旋转基 PCA 将 token 相关的通道重要性对齐到共享的低维子空间,从而在轻量级 head-wise 掩码下实现精准剪枝;融合的 Triton 注意力内核可直接对稀疏通道的 Key 进行高效解码。实验表明,在两种代表性 VLM 主干网络上,RotateK 在准确率和解码延迟方面均优于现有关键通道剪枝方法,而联合 token-channel 剪枝在匹配 KV 缓存预算下优于仅基于 token 的基线方法。

关键词

引用

@article{arxiv.2605.19218,
  title  = {Rotation-Aligned Key Channel Pruning for Efficient Vision-Language Model Inference},
  author = {Beomseok Kang and Dongwon Jo and Jiwon Song and Donghwee Son and Jae-Joon Kim},
  journal= {arXiv preprint arXiv:2605.19218},
  year   = {2026}
}