中文

图像斑块化的缩放定律:一张图像价值 50,176 个令牌甚至更多

计算机视觉与模式识别 2026-02-23 v2

摘要

自 Vision Transformer(ViT)问世以来,图像斑块化(patchification)一直被视为普通视觉架构事实上的图像分词方法。通过压缩图像的空间尺寸,这种方法可以有效缩短令牌序列并降低类似 ViT 的普通架构的计算成本。在这项工作中,我们旨在彻底检验这种基于斑块化的压缩编码范式所造成的信息损失及其如何影响视觉理解。我们进行了广泛的斑块尺寸缩放实验,并兴奋地观察到图像斑块化中一个有趣的缩放定律:模型能够持续从减小的斑块尺寸中受益,并获得更好的预测性能,直至达到 1x1 的最小斑块尺寸,即像素级分词。这一结论广泛适用于不同的视觉任务、各种输入尺度以及多种架构,如 ViT 和最近的 Mamba 模型。此外,作为附带发现,我们发现在使用更小斑块时,任务特定的解码器头对于密集预测变得不那么关键。在实验中,我们成功地将视觉序列扩展到 50,176 个令牌的异常长度,在 ImageNet-1k 基准上使用基础尺寸模型达到了 84.6% 的有竞争力的测试准确率。我们希望这项研究能为未来构建非压缩视觉模型的工作提供见解和理论基础。代码可在 https://github.com/wangf3014/Patch_Scaling 获取。

关键词

引用

@article{arxiv.2502.03738,
  title  = {Scaling Laws in Patchification: An Image Is Worth 50,176 Tokens And More},
  author = {Feng Wang and Yaodong Yu and Guoyizhe Wei and Wei Shao and Yuyin Zhou and Alan Yuille and Cihang Xie},
  journal= {arXiv preprint arXiv:2502.03738},
  year   = {2026}
}