中文

随机获胜:重新思考视觉标记的分组策略

计算机视觉与模式识别 2026-03-03 v1

摘要

自 Transformer 引入视觉架构以来,其二次复杂度始终是众多研究努力要解决的重要问题。一种代表性方法是对标记进行分组,在每个分组内进行自注意力计算,或对每个分组内的标记进行池化以获得单个标记。为此,提出了各种精心设计的分组策略,以提升视觉 Transformer 的性能。本文提出以下问题:\textbf{这些精心设计的分组方法真的必要吗?是否存在一种更简单且更统一的标记分组方法来取代这些多样化的方法?}因此,我们提出了随机分组策略,这是一种用于视觉标记的简单且快速的随机分组方法。我们在多个基线上验证了这一方法,实验表明随机分组几乎甚至超过所有其他分组方法。当迁移到下游任务(如目标检测)时,随机分组的优势更为显著。针对这一现象,我们从多个角度详细分析了随机分组的优势,并确定了分组策略设计的几个关键要素:位置信息、头部特征多样性、全局感受野以及固定分组模式。我们展示,只要满足这四个条件,视觉标记就只需一种极其简单的分组策略即可高效、有效地处理各种视觉任务。我们还在多个模态上验证了所提出随机方法的有效性,包括视觉任务、点云处理和视觉语言模型。代码将在 https://github.com/qhfan/random 上提供。

关键词

引用

@article{arxiv.2603.00486,
  title  = {Random Wins All: Rethinking Grouping Strategies for Vision Tokens},
  author = {Qihang Fan and Yuang Ai and Huaibo Huang and Ran He},
  journal= {arXiv preprint arXiv:2603.00486},
  year   = {2026}
}

备注

Accepted by CVPR2026