中文

重新思考神经网络泛化的偏差-方差权衡

机器学习 2020-12-09 v3 机器学习

摘要

经典偏差-方差权衡预测偏差随模型复杂度增加而减小、方差增大,从而导致 U 形风险曲线。近期工作对神经网络及其他过参数化模型的这一结论提出质疑,因为常观察到更大的模型泛化更好。我们通过度量神经网络的偏差和方差给出了一个简单的解释:偏差如经典理论般单调下降,而方差呈单峰或钟形:它随网络宽度先增后减。我们改变网络架构、损失函数和数据集选择,并确认方差单峰性在我们考虑的所有模型中稳健出现。风险曲线是偏差与方差曲线之和,并依据偏差与方差的相对尺度呈现不同定性形状,近期文献中观察到的双下降曲线作为特例。我们用双层线性网络(随机第一层)的理论分析佐证了这些实证结果。最后,分布外数据上的评估表明,准确率下降主要源于偏差增大,而方差仅相对小幅增加。此外,我们发现更深的模型对分布内与分布外数据均减小偏差并增大方差。

关键词

引用

@article{arxiv.2002.11328,
  title  = {Rethinking Bias-Variance Trade-off for Generalization of Neural Networks},
  author = {Zitong Yang and Yaodong Yu and Chong You and Jacob Steinhardt and Yi Ma},
  journal= {arXiv preprint arXiv:2002.11328},
  year   = {2020}
}