Visual Atoms:用正弦波预训练视觉 Transformer
计算机视觉与模式识别
2023-03-03 v1 人工智能
机器学习
摘要
公式驱动监督学习(FDSL)已被证明是预训练视觉 Transformer 的有效方法,其中 ExFractalDB-21k 被显示超越 ImageNet-21k 的预训练效果。这些研究也表明,在预训练视觉 Transformer 时轮廓比纹理更重要。然而,对于为何这些面向轮廓的合成数据集能达到与真实数据集同等的精度,缺乏系统性探究,这留下了诸多质疑空间。在本工作中,我们基于圆谐函数开发了一种新颖的方法论,用于系统性地研究面向轮廓的合成数据集的设计空间。这使我们能高效搜索 FDSL 参数的最优范围,并最大化数据集中合成图像的多样性,我们发现这是一个关键因素。当所得新数据集 VisualAtom-21k 用于预训练 ViT-Base 时,在 ImageNet-1k 上微调后 top-1 精度达到 83.7%。这接近 JFT-300M 预训练所实现的 top-1 精度(84.2%),而图像数量仅为 1/14。与作为静态数据集的 JFT-300M 不同,合成数据集的质量将持续提升,当前工作即是这一可能性的明证。FDSL 也免除了真实图像相关的常见问题,例如隐私/版权问题、标注成本/错误以及伦理偏见。
引用
@article{arxiv.2303.01112,
title = {Visual Atoms: Pre-training Vision Transformers with Sinusoidal Waves},
author = {Sora Takashima and Ryo Hayamizu and Nakamasa Inoue and Hirokatsu Kataoka and Rio Yokota},
journal= {arXiv preprint arXiv:2303.01112},
year = {2023}
}
备注
Accepted to CVPR 2023