中文

超越平面国:具有强三维归纳偏置的预训练

计算机视觉与模式识别 2021-12-02 v1 人工智能

摘要

在由自然图像组成的大规模数据库上预训练,然后微调以适配具体应用,或称迁移学习,是计算机视觉中的流行策略。然而,Kataoka 等人(2020)引入了一种技术,通过提出一种新颖的基于公式的合成方法生成 2D 分形作为训练语料,从而消除了监督深度学习中自然图像的需求。他们为每个类别使用一个合成生成的分形,取得了与自然图像预训练模型相当的迁移学习效果。在本项目中,我们受他们工作的启发并基于该思想构建——使用 3D 程序化物体渲染图。由于自然世界的图像形成过程基于其 3D 结构,我们期望使用 3D 网格渲染图进行预训练能提供隐式偏置,从而在迁移学习设定下带来更好的泛化能力,并且基于 3D 数据更容易学习到对 3D 旋转与光照的不变性。与先前工作类似,我们的训练语料将完全合成并源自简单的程序化策略;我们将超越经典数据增强,同时改变在我们设定下可控的光照与姿态,并研究它们相对于先前工作在迁移学习能力上的影响。此外,我们将 2D 分形与 3D 程序化物体网络与人类及非人灵长类大脑数据进行比较,以更多地了解生物视觉的 2D 与 3D 本质。

关键词

引用

@article{arxiv.2112.00113,
  title  = {Beyond Flatland: Pre-training with a Strong 3D Inductive Bias},
  author = {Shubhaankar Gupta and Thomas P. O'Connell and Bernhard Egger},
  journal= {arXiv preprint arXiv:2112.00113},
  year   = {2021}
}

备注

NeurIPS 2021 pre-registration workshop