PixelPrune:基于预测编码的像素级自适应视觉标记降低
计算机视觉与模式识别
2026-04-02 v1 人工智能
计算与语言
摘要
文档理解和GUI交互是视觉语言模型(VLM)中价值最高的应用,但会带来异常沉重的计算负担:细粒度文本和小型UI元素需要高分辨率输入,产生数万个视觉标记。我们观察到,这种成本在很大程度上是浪费的——在文档和GUI基准测试中,只有22--71%的图像块是像素唯一的,其余是同一图像中其他块的完全重复。我们提出了PixelPrune,通过预测编码基础压缩, 在Vision Transformer(ViT)编码器之前修剪冗余块。由于它在像素空间中操作,无需任何神经计算,PixelPrune可加速ViT编码器以及下游LLM,覆盖整个推理管道。该方法无需训练、无需可学习参数,支持像素无损压缩()以及受控有损压缩()。在三个模型规模和文档、GUI基准测试方面的实验表明,PixelPrune在保持竞争任务准确率的同时,实现了最高可达4.2的推理加速和1.9的训练加速。代码已提供于https://github.com/OPPO-Mente-Lab/PixelPrune。
引用
@article{arxiv.2604.00886,
title = {PixelPrune: Pixel-Level Adaptive Visual Token Reduction via Predictive Coding},
author = {Nan Wang and Zhiwei Jin and Chen Chen and Haonan Lu},
journal= {arXiv preprint arXiv:2604.00886},
year = {2026}
}