中文

学习可逆输出映射可缓解神经网络中的简单性偏差

机器学习 2022-10-05 v1

摘要

已知深度神经网络相较于训练分布即使面对微小分布偏移也十分脆弱。一方面,有工作表明神经网络的简单性偏差(SB)——即偏向于仅学习最简单特征——是此种脆弱性的关键原因;而另一方面,近期有工作意外发现骨干网络确实学习了多样/复杂特征,其脆弱性源于线性分类头主要依赖最简单特征。为弥合这两类工作间的分歧,我们首先假设并验证:尽管 SB 未必完全阻碍复杂特征学习,它会放大简单特征甚于复杂特征。即,简单特征在所学表征中被多次复制,而复杂特征可能未被复制。我们将此现象称为特征复制假设,其与 SGD 在特征空间收敛至最大间隔解的隐式偏差相结合,导致模型主要依赖简单特征进行分类。为缓解此偏差,我们提出特征重建正则化器(FRR)以确保所学特征可由 logits 重建。在线性层训练中使用 FRR(FRR-L)可促使分类利用更多样特征。我们进一步提出通过冻结经 FRR-L 训练的线性层权重来微调整个网络,以精炼所学特征使其更适于分类。利用这一简单方案,我们在近期提出的具极端分布偏移的半合成数据集上展示了 OOD 准确率最高提升 15%。此外,我们在标准 OOD 基准 DomainBed 上也展示了相对于现有 SOTA 方法的显著增益。

关键词

引用

@article{arxiv.2210.01360,
  title  = {Learning an Invertible Output Mapping Can Mitigate Simplicity Bias in Neural Networks},
  author = {Sravanti Addepalli and Anshul Nasery and R. Venkatesh Babu and Praneeth Netrapalli and Prateek Jain},
  journal= {arXiv preprint arXiv:2210.01360},
  year   = {2022}
}