中文

PixelPrune:基于预测编码的像素级自适应视觉标记降低

计算机视觉与模式识别 2026-04-02 v1 人工智能 计算与语言

摘要

文档理解和GUI交互是视觉语言模型(VLM)中价值最高的应用,但会带来异常沉重的计算负担:细粒度文本和小型UI元素需要高分辨率输入,产生数万个视觉标记。我们观察到,这种成本在很大程度上是浪费的——在文档和GUI基准测试中,只有22--71%的图像块是像素唯一的,其余是同一图像中其他块的完全重复。我们提出了PixelPrune,通过预测编码基础压缩, 在Vision Transformer(ViT)编码器之前修剪冗余块。由于它在像素空间中操作,无需任何神经计算,PixelPrune可加速ViT编码器以及下游LLM,覆盖整个推理管道。该方法无需训练、无需可学习参数,支持像素无损压缩(τ=0\tau{=}0)以及受控有损压缩(τ>0\tau{>}0)。在三个模型规模和文档、GUI基准测试方面的实验表明,PixelPrune在保持竞争任务准确率的同时,实现了最高可达4.2×\times的推理加速和1.9×\times的训练加速。代码已提供于https://github.com/OPPO-Mente-Lab/PixelPrune。

关键词

引用

@article{arxiv.2604.00886,
  title  = {PixelPrune: Pixel-Level Adaptive Visual Token Reduction via Predictive Coding},
  author = {Nan Wang and Zhiwei Jin and Chen Chen and Haonan Lu},
  journal= {arXiv preprint arXiv:2604.00886},
  year   = {2026}
}