中文

基于区域、Token 与指令引导重要性的高分辨率大型视觉语言模型金字塔 Token 剪枝

计算机视觉与模式识别 2026-02-17 v2

摘要

大型视觉语言模型(LVLM)近期展现出强大的多模态理解能力,但其细粒度视觉感知常受限于低输入分辨率。一种常见的补救方法是将高分辨率图像划分为多个子图像分别编码,但这会急剧增加视觉 token 的数量,并带来难以承受的推理开销。为克服这一挑战,我们提出了金字塔 Token 剪枝(PTP),这是一种无训练策略,在区域和 token 级别将自底向上的视觉显著性自顶向下的指令引导相关性分层整合。受人类视觉认知启发,PTP 选择性地保留来自显著区域的更多 token,同时进一步强调与任务指令最相关的 token。在 13 个多样化基准上的广泛实验表明,PTP 大幅降低了计算成本、内存使用和推理延迟,且性能下降可忽略不计。

关键词

引用

@article{arxiv.2509.15704,
  title  = {Pyramid Token Pruning for High-Resolution Large Vision-Language Models via Region, Token, and Instruction-Guided Importance},
  author = {Yuxuan Liang and Xu Li and Xiaolei Chen and Yi Zheng and Haotian Chen and Bin Li and Xiangyang Xue},
  journal= {arXiv preprint arXiv:2509.15704},
  year   = {2026}
}