中文

视觉表征学习在同一领域内不能强泛化

机器学习 2022-02-15 v4 计算机视觉与模式识别

摘要

机器学习中泛化的一个重要组成部分是揭示潜在的变异潜因子以及各因子在世界中作用的机制。在本文中,我们测试了17种无监督、弱监督和全监督表征学习方法是否能从受控环境中的简单数据集(dSprites、Shapes3D、MPI3D)以及我们贡献的CelebGlow数据集中正确推断出变异的生成因子。与先前在测试时引入新颖变异因子(如模糊或其他(非)结构化噪声)的鲁棒性工作不同,我们在此仅对训练数据集中的已有变异因子进行重组、插值或外推(例如训练时为小和中型物体,测试时为大型物体)。学到正确机制的模型应当能够泛化至该基准。我们总共训练并测试了2000多个模型,观察到无论监督信号和架构偏置如何,它们都难以学习底层机制。此外,所有被测模型的泛化能力在从人工数据集转向更真实的现实世界数据集时显著下降。尽管无法识别正确机制,这些模型颇具模块化特性:只要仅单一因子为分布外,其推断其他分布内因子的能力保持相当稳定。这些结果指向一个重要却被低估的问题,即学习可促进泛化的观测机制模型。

关键词

引用

@article{arxiv.2107.08221,
  title  = {Visual Representation Learning Does Not Generalize Strongly Within the Same Domain},
  author = {Lukas Schott and Julius von Kügelgen and Frederik Träuble and Peter Gehler and Chris Russell and Matthias Bethge and Bernhard Schölkopf and Francesco Locatello and Wieland Brendel},
  journal= {arXiv preprint arXiv:2107.08221},
  year   = {2022}
}