中文

Tango: 高效视频大语言模型的视觉信号调控

计算机视觉与模式识别 2026-04-14 v2

摘要

token 剪枝已成为开发高效视频大语言模型(Video LLMs)的主流方法。本 work revisits and advances 两种主要 token 剪枝范式:基于注意力的选择和基于相似性的聚类。我们的研究揭示了现有方法的两个关键局限性:(1)常规的 top-k 选择策略未充分考虑注意力分布,这种分布在空间上常呈多模态且幅值呈长尾分布;(2)直接的基于相似性的聚类常生成碎片化聚类,导致池化后产生扭曲的表示。为解决这些瓶颈,我们提出 Tango,一个旨在优化视觉信号利用的新框架。Tango 集成了多样性驱动的策略来增强基于注意力的 token 选择,并引入时空旋转位置编码(ST-RoPE)通过局部先验保留几何结构。广泛的实验在各种 Video LLMs 和视频理解基准测试中表明我们方法的有效性和通用性。值得注意的是,在仅保留 10% 视频 tokens 的情况下,Tango 在 LLaVA-OV 上保留了 98.9% 的原始性能,同时实现了 1.88倍的推理加速。

关键词

引用

@article{arxiv.2604.09547,
  title  = {Tango: Taming Visual Signals for Efficient Video Large Language Models},
  author = {Shukang Yin and Sirui Zhao and Hanchao Wang and Baozhi Jia and Xianquan Wang and Chaoyou Fu and Enhong Chen},
  journal= {arXiv preprint arXiv:2604.09547},
  year   = {2026}
}

备注

Code: https://github.com/xjtupanda/Tango