中文

CubistMerge:面向多样ViT主干网络的空间保留Token合并

计算机视觉与模式识别 2026-03-03 v2 机器学习

摘要

许多现代ViT主干网络采用了空间架构设计,例如窗口注意力、SAM中分解的相对位置嵌入以及DINOv3中的RoPE。此类架构对Token缩减提出了新的挑战,因为绝大多数现有方法无法保留这些架构所依赖的空间结构。在本文中,我们引入了一种简单而有效的Token合并方法,该方法保持了空间完整性,从而能够与空间架构无缝兼容。我们调和了两个看似冲突的需求:(i) 利用空间布局中不均匀的信息分布,同时 (ii) 在合并后保留空间结构。我们的方法采用 (i) 2D缩减策略以强制执行结构化的Token布局,(ii) 保持Token相对位置的空间感知合并算法,以及 (iii) 保留显著特征的新型逐维最大幅度Token表示。我们的方法在开箱即用和微调下均表现出色,在各种视觉任务的空间和非空间架构上取得了state-of-the-art的结果。具体而言,我们在SAM-H上实现了1.25倍加速,在COCO上开箱即用评估时mIOU仅下降0.7%;在DeiT-B上仅微调一个epoch即实现了1.15倍加速,且在ImageNet上top-1准确率无下降。

关键词

引用

@article{arxiv.2509.21764,
  title  = {CubistMerge: Spatial-Preserving Token Merging For Diverse ViT Backbones},
  author = {Wenyi Gong and Mieszko Lis},
  journal= {arXiv preprint arXiv:2509.21764},
  year   = {2026}
}