中文

动态粒度至关重要:超越固定分块的视觉变换器

计算机视觉与模式识别 2025-11-25 v1

摘要

视觉变换器(Vision Transformers, ViTs)在捕获全局依赖性方面表现出强大的能力,但往往难以有效表示细粒度的局部细节。现有的多尺度方法通过集成层次或混合特征来缓解此问题,但这些方法依赖固定的补丁大小,引入冗余计算。为此,我们提出了一种基于粒度驱动的视觉变换器(Granularity-driven Vision Transformer, Grc-ViT),其为一个动态粗到细框架,能够根据图像复杂度自适应调整视觉粒度。它包含两个关键阶段:(1)粗粒度评估模块,通过边缘密度、熵和频域线索评估图像的视觉复杂度,以估计合适的补丁和窗口大小;(2)细粒度细化模块,根据所选粒度细化注意力计算,以实现高效且精确的特征学习。我们优化两个可学习的参数 α\alphaβ\beta,以在全局推理和局部感知之间实现更佳的权衡。全面评估表明,Grc-ViT 在细粒度判别能力方面得到提升,同时在准确率和计算效率之间实现卓越的权衡。

关键词

引用

@article{arxiv.2511.19021,
  title  = {Dynamic Granularity Matters: Rethinking Vision Transformers Beyond Fixed Patch Splitting},
  author = {Qiyang Yu and Yu Fang and Tianrui Li and Xuemei Cao and Yan Chen and Jianghao Li and Fan Min},
  journal= {arXiv preprint arXiv:2511.19021},
  year   = {2025}
}

备注

10 pages, 7 figures