中文

你能学会不看图像吗?面向视觉Transformer的程序化热身

计算机视觉与模式识别 2026-03-24 v2

摘要

Transformer具有惊人的多样性,这表明其具备跨模态的通用归纳偏置。在本工作中,我们通过对没有视觉或语义内容的程序化数据进行预训练,探索了一种为视觉Transformer(ViT)注入此类偏置的新方法。我们使用诸如形式语法等简单算法生成此类数据,其结果与自然图像或合成图像之间毫无关联。我们使用该程序化数据进行预训练,以 warm-up 阶段绕过视觉 patch embedding 机制,从而鼓励模型内化抽象计算先验。随后进行常规图像训练时,这一 warm-up显著提高了数据效率、收敛速度和下游性能。例如,在ImageNet-1K上,仅将1%的训练预算分配给程序化数据,即可提高最终准确率超过1.7%。从性能效果来看,1%的程序化数据相当于28%的ImageNet-1K数据。这些发现表明,一种具有前景的、面向数据高效和领域无关预训练策略的路径正在展现出来。

关键词

引用

@article{arxiv.2511.13945,
  title  = {Can You Learn to See Without Images? Procedural Warm-Up for Vision Transformers},
  author = {Zachary Shinnick and Liangze Jiang and Hemanth Saratchandran and Damien Teney and Anton van den Hengel},
  journal= {arXiv preprint arXiv:2511.13945},
  year   = {2026}
}

备注

Camera-ready version