中文

利用极有限合成图像预训练视觉Transformer

计算机视觉与模式识别 2023-08-01 v2

摘要

公式驱动监督学习(FDSL)是一种预训练方法,依赖于从分形等数学公式生成的合成图像。先前关于 FDSL 的工作表明,在此类合成数据集上预训练视觉Transformer可在广泛的下游任务上获得有竞争力的准确率。这些合成图像根据生成它们的数学公式中的参数进行分类。在本工作中,我们假设 FDSL 中为同一类别生成不同实例的过程可被视为一种数据增强形式。我们通过用数据增强替换实例来验证该假设,这意味着每个类别仅需一张图像。我们的实验表明,这种单实例分形数据库(OFDB)优于显式生成实例的原始数据集。我们进一步将 OFDB 扩展到 21,000 个类别,并表明在 ImageNet-1k 微调中,它与在 ImageNet-21k 上预训练的模型相匹配甚至超越。OFDB 中的图像数量为 21k,而 ImageNet-21k 有 14M。这为利用小得多的数据集预训练视觉Transformer开辟了新可能。

关键词

引用

@article{arxiv.2307.14710,
  title  = {Pre-training Vision Transformers with Very Limited Synthesized Images},
  author = {Ryo Nakamura and Hirokatsu Kataoka and Sora Takashima and Edgar Josafat Martinez Noriega and Rio Yokota and Nakamasa Inoue},
  journal= {arXiv preprint arXiv:2307.14710},
  year   = {2023}
}

备注

Accepted to ICCV 2023