动态粒度至关重要:超越固定分块的视觉变换器
计算机视觉与模式识别
2025-11-25 v1
摘要
视觉变换器(Vision Transformers, ViTs)在捕获全局依赖性方面表现出强大的能力,但往往难以有效表示细粒度的局部细节。现有的多尺度方法通过集成层次或混合特征来缓解此问题,但这些方法依赖固定的补丁大小,引入冗余计算。为此,我们提出了一种基于粒度驱动的视觉变换器(Granularity-driven Vision Transformer, Grc-ViT),其为一个动态粗到细框架,能够根据图像复杂度自适应调整视觉粒度。它包含两个关键阶段:(1)粗粒度评估模块,通过边缘密度、熵和频域线索评估图像的视觉复杂度,以估计合适的补丁和窗口大小;(2)细粒度细化模块,根据所选粒度细化注意力计算,以实现高效且精确的特征学习。我们优化两个可学习的参数 和 ,以在全局推理和局部感知之间实现更佳的权衡。全面评估表明,Grc-ViT 在细粒度判别能力方面得到提升,同时在准确率和计算效率之间实现卓越的权衡。
引用
@article{arxiv.2511.19021,
title = {Dynamic Granularity Matters: Rethinking Vision Transformers Beyond Fixed Patch Splitting},
author = {Qiyang Yu and Yu Fang and Tianrui Li and Xuemei Cao and Yan Chen and Jianghao Li and Fan Min},
journal= {arXiv preprint arXiv:2511.19021},
year = {2025}
}
备注
10 pages, 7 figures