中文

将归纳偏置根植于自然图像:不变性源于数据中的变化

计算机视觉与模式识别 2021-11-17 v2

摘要

为在未见且可能分布外样本上表现良好,机器学习模型最好能对影响输入变化因子的变换给出可预测响应。在此,我们研究若干类归纳偏置对此种可预测行为的相对重要性:数据选择、数据增强与模型架构。不变性通常通过手工设计的数据增强实现,但标准数据增强是否处理了解释真实数据变化的变换?先前工作聚焦于合成数据,而此处我们尝试刻画真实数据集 ImageNet 中的变化因子,并研究标准残差网络与近期提出的视觉 transformer 相对于这些因子变化的不变性。我们表明标准增强依赖于平移与尺度的精确组合,其中平移挽回了大部分性能提升——尽管诸如残差网络之类的卷积架构内置了(近似)平移不变性。事实上,我们发现尽管残差网络与视觉 transformer 模型的架构归纳偏置明显不同,其尺度与平移不变性却相似。我们表明训练数据本身是不变性的主要来源,而数据增强仅进一步增大了所学不变性。值得注意的是,训练期间学到的不变性与我们发现的 ImageNet 变化因子相一致。最后,我们发现 ImageNet 中的主要变化因子大多与外观有关且因类别而异。

关键词

引用

@article{arxiv.2106.05121,
  title  = {Grounding inductive biases in natural images:invariance stems from variations in data},
  author = {Diane Bouchacourt and Mark Ibrahim and Ari S. Morcos},
  journal= {arXiv preprint arXiv:2106.05121},
  year   = {2021}
}