中文

双层ReLU卷积神经网络的良性过拟合

机器学习 2023-11-07 v2 最优化与控制 机器学习

摘要

具有强大表达能力的现代深度学习模型可被训练至过拟合训练数据,却仍具备良好泛化能力。该现象被称为\textit{良性过拟合}。近期,少数研究试图从理论上理解神经网络中的良性过拟合。然而,这些工作要么局限于具有平滑激活函数的神经网络,要么局限于神经正切核机制。ReLU神经网络中何时以及如何发生良性过拟合仍是一个开放问题。本工作中,我们旨在通过建立依赖于算法的风险界来回答该问题,所涉对象为在标签翻转噪声下学习的双层ReLU卷积神经网络。我们表明,在温和条件下,经梯度下降训练的神经网络可达到近零训练损失与贝叶斯最优测试风险。我们的结果还揭示了在不同数据分布条件下,就测试风险而言良性过拟合与有害过拟合之间的尖锐转变。合成数据上的实验支持了我们的理论。

关键词

引用

@article{arxiv.2303.04145,
  title  = {Benign Overfitting for Two-layer ReLU Convolutional Neural Networks},
  author = {Yiwen Kou and Zixiang Chen and Yuanzhou Chen and Quanquan Gu},
  journal= {arXiv preprint arXiv:2303.04145},
  year   = {2023}
}

备注

45 pages, 3 figures, 2 tables. In ICML 2023