中文

DART:面向视觉基础模型的可微分动态自适应区域分词器

计算机视觉与模式识别 2025-09-30 v3

摘要

标准大规模视觉模型(如 Vision Transformer(ViT)和 Vision Mamba(Vim))所使用的与内容无关的固定网格分词器是一个根本性的性能瓶颈,在捕获细粒度细节与遭受冗余计算之间存在权衡。为解决这一困境,我们引入了 DART,一个完全可微分的动态自适应区域分词器。DART 采用可学习区域分数和基于分位数的分区来创建内容感知的、大小各异的补丁,智能地为信息丰富的区域分配更高的标记密度。该方法的影响是深远的:它解锁了一种更智能的扩展范式,其中配备 DART 的 DeiT-Small(22M 参数)以近两倍的推理速度匹配了 DeiT-Base(86M)的性能,通过高效捕获关键区域中的高分辨率细节。此外,自适应分词化原则证明了其通用性,在密集预测和时空视频任务中具有明显优势。我们认为,通过从根本上解决分词器瓶颈,自适应分词化是构建下一代更高效、更强大的多模态 AI、机器人和内容生成基础模型的关键组成部分。代码可在 https://github.com/HCPLab-SYSU/DART 获取。

关键词

引用

@article{arxiv.2506.10390,
  title  = {DART: Differentiable Dynamic Adaptive Region Tokenizer for Vision Foundation Models},
  author = {Shicheng Yin and Kaixuan Yin and Yang Liu and Weixing Chen and Liang Lin},
  journal= {arXiv preprint arXiv:2506.10390},
  year   = {2025}
}

备注

Code is available at https://github.com/HCPLab-SYSU/DART