基于公式驱动监督学习的视觉 Transformer 预训练
计算机视觉与模式识别
2025-12-29 v2 人工智能
机器学习
摘要
在本研究中,我们表明在视觉 Transformer (ViTs) 的预训练过程中,不使用真实图像、人工监督或自监督,公式驱动监督学习 (FDSL) 的性能可以匹配甚至超过 ImageNet-21k,并接近 JFT-300M 数据集的性能。例如,在 ImageNet-21k 和 JFT-300M 上预训练的 ViT-Base 在 ImageNet-1k 上微调时分别表现出 83.0% 和 84.1% 的 top-1 准确率,而 FDSL 在可比条件下(超参数和 epoch 数)预训练时表现出 83.8% 的 top-1 准确率。特别是,与 JFT-300M 相比,ExFractalDB-21k 的预训练计算所需的图像数量减少了 14.2 倍。由公式生成的图像避免了真实图像所面临的隐私和版权问题、标注成本与错误以及偏差,因此在预训练通用模型方面具有巨大潜力。为了理解合成图像的性能,我们测试了两个假设,即 物体轮廓是 FDSL 数据集中的关键因素 以及 用于标签创建的参数数量增加能提升 FDSL 预训练的性能。为了测试前一个假设,我们构建了一个由简单物体轮廓组合构成的数据集。我们发现该数据集的性能与分形数据库相匹配。对于后一个假设,我们发现增加预训练任务的难度通常能带来更好的微调准确率。
引用
@article{arxiv.2206.09132,
title = {Pre-training Vision Transformers with Formula-driven Supervised Learning},
author = {Hirokatsu Kataoka and Sora Takashima and Ryo Hayamizu and Ryosuke Yamada and Kodai Nakashima and Xinyu Zhang and Edgar Josafat Martinez-Noriega and Nakamasa Inoue and Rio Yokota},
journal= {arXiv preprint arXiv:2206.09132},
year = {2025}
}