中文

Scaling Backwards:最小化合成预训练

计算机视觉与模式识别 2024-08-06 v2

摘要

预训练和迁移学习是当前计算机视觉系统的重要构建模块。虽然通常会在大型真实图像数据集上进行预训练,但本文我们提出了一个问题:这是否真的必要?为此,我们寻找一种最小化的纯合成预训练数据集,以实现与 ImageNet-1k 中 100 万张图像相当的性能。我们从单个分形及其扰动构建了此数据集。我们贡献了三个主要发现。(i) 我们表明,即使在最小合成图像上,预训练也有效,对于完全微调,在 ImageNet-1k 等大规模预训练数据集上性能相当。(ii) 我们研究了用于构建人工类别的数据集的唯一参数。我们发现,尽管形状差异对人类而言难以辨别,但它们对于获得强性能至关重要。(iii) 我们最终研究了成功预训练的最小要求。令人惊讶的是,我们发现将合成图像从 1000 缩减至 1 甚至会导致预训练性能提升,进一步激发了“反向扩展”的动力。最后,我们将方法从合成图像扩展到真实图像,看看单张真实图像是否可以通过形状增强显示类似的预训练效果。我们发现,采用灰度图像和仿射变换,即使是真实图像也能实现“反向扩展”。

关键词

引用

@article{arxiv.2408.00677,
  title  = {Scaling Backwards: Minimal Synthetic Pre-training?},
  author = {Ryo Nakamura and Ryu Tadokoro and Ryosuke Yamada and Yuki M. Asano and Iro Laina and Christian Rupprecht and Nakamasa Inoue and Rio Yokota and Hirokatsu Kataoka},
  journal= {arXiv preprint arXiv:2408.00677},
  year   = {2024}
}

备注

Accepted to ECCV2024