通过可变补丁大小加速视觉 Transformer
计算机视觉与模式识别
2026-04-24 v2 人工智能
机器学习
摘要
视觉 Transformer (ViT) 将输入图像划分为均匀大小的补丁,忽略图像内容,导致高分辨率图像具有长序列长度。我们提出的自适应补丁 Transformer (APT) 通过在同一图像中使用多种不同补丁大小来解决此问题。APT 在更均匀的区域分配较大补丁大小,在更复杂的区域分配较小补丁,从而显著减少输入标记的总数。APT 实现了对 ViT 推理和训练的显著加速,在 ViT-L 上提升吞吐量 40%,在 ViT-H 上提升 50%,同时保持下游性能,可以应用于已微调的 ViT,最短仅需 1 个 epoch 即可收敛。在不损失性能的情况下,显著减少高分辨率密集视觉任务的训练和推理时间,在视觉问答、目标检测和语义分割中实现最高 30% 的训练和推理加速。
引用
@article{arxiv.2510.18091,
title = {Accelerating Vision Transformers with Adaptive Patch Sizes},
author = {Rohan Choudhury and JungEun Kim and Jinhyung Park and Eunho Yang and László A. Jeni and Kris M. Kitani},
journal= {arXiv preprint arXiv:2510.18091},
year = {2026}
}
备注
Accepted to ICLR 2026. Project page at https://rccchoudhury.github.io/apt/