中文

去相关加速视觉Transformer

计算机视觉与模式识别 2026-01-16 v3 机器学习

摘要

掩码自编码器(MAE)预训练的视觉Transformer(ViT)在低标签数据场景下表现优异,但计算成本高昂,在时间和资源受限的工业环境中难以实际应用。我们通过将去相关反向传播(DBP)集成到MAE预训练中,解决了这一问题。该优化方法在每一层迭代性地减少输入相关性,从而加快收敛速度。仅应用于编码器,DBP能够在不牺牲稳定性的前提下实现更快的预训练。为模拟受限数据场景,我们在ImageNet-1K上进行预训练,在ADE20K上进行微调时,使用随机抽样的每个数据集的子集。在此设置下,DBP-MAE将实现基准性能的墙钟时间缩短21.1%,碳排放降低21.4%,分割mIoU提高1.1分。我们在预训练和微调使用专有工业数据时也观察到类似的收益,确认了该方法在实际场景中的适用性。这些结果表明,DBP可以在大规模ViT预训练期间减少训练时间和能源消耗,同时提升下游性能。

关键词

引用

@article{arxiv.2510.14657,
  title  = {Decorrelation Speeds Up Vision Transformers},
  author = {Kieran Carrigg and Rob van Gastel and Melda Yeghaian and Sander Dalm and Faysal Boughorbel and Marcel van Gerven},
  journal= {arXiv preprint arXiv:2510.14657},
  year   = {2026}
}

备注

20 pages, 12 figures, CVC 2026 camera-ready version