中文

我们能否避免深度神经网络中的双下降现象?

机器学习 2023-12-27 v4 人工智能

摘要

寻找深度学习模型的最优规模极具现实意义的且影响广泛,尤其在节能方案中。最近,一种出乎意料的现象——“双下降(double descent)”——引起了深度学习界的关注。随着模型规模增大,性能先变差,随后又改善。这引发了关于维持高泛化能力的最优模型规模的重大疑问:模型需足够过参数化,但添加过多参数会浪费训练资源。能否高效地找到最佳权衡?我们的工作表明,通过适当的条件化处理学习问题,双下降现象潜在可避免,但最终答案尚待发现。我们通过实证观察到,在复杂场景下借助适当正则化有望规避双下降,如简单的 2\ell_2 正则化已对此视角产生积极作用。

关键词

引用

@article{arxiv.2302.13259,
  title  = {Can we avoid Double Descent in Deep Neural Networks?},
  author = {Victor Quétu and Enzo Tartaglione},
  journal= {arXiv preprint arXiv:2302.13259},
  year   = {2023}
}