中文

规避简单性偏置:训练多样化模型集发现具有更优分布外泛化能力的解决方案

机器学习 2022-09-13 v3 计算机视觉与模式识别

摘要

最近研究表明,用 SGD 训练的神经网络优先依赖线性可预测特征,并可能忽略复杂的、同等可预测的特征。这种简单性偏置可以解释它们分布外(OOD)鲁棒性的缺乏。要学习的任务越复杂,统计伪像(即选择偏置、虚假相关性)比待学习的机制更简单可能性越大。我们证明简单性偏置可以被缓解且 OOD 泛化可以得到改善。我们训练一组相似模型以不同方式拟合数据,使用对其输入梯度对齐的惩罚。我们从理论和经验上表明这促使学习更复杂的预测模式。OOD 泛化从根本上需要超出 i.i.d. 样本的信息,例如多个训练环境、反事实样本或其他侧信息。我们的方法表明我们可以将这一要求推迟到独立的模型选择阶段。我们在偏置数据上的视觉识别和跨视觉域泛化方面获得了 SOTA 结果。该方法——首个规避简单性偏置的方法——凸显了深度学习中更好理解并控制归纳偏置的必要性。

关键词

引用

@article{arxiv.2105.05612,
  title  = {Evading the Simplicity Bias: Training a Diverse Set of Models Discovers Solutions with Superior OOD Generalization},
  author = {Damien Teney and Ehsan Abbasnejad and Simon Lucey and Anton van den Hengel},
  journal= {arXiv preprint arXiv:2105.05612},
  year   = {2022}
}

备注

CVPR 2022