我们能否避免深度神经网络中的双下降现象?
机器学习
2023-12-27 v4 人工智能
摘要
寻找深度学习模型的最优规模极具现实意义的且影响广泛,尤其在节能方案中。最近,一种出乎意料的现象——“双下降(double descent)”——引起了深度学习界的关注。随着模型规模增大,性能先变差,随后又改善。这引发了关于维持高泛化能力的最优模型规模的重大疑问:模型需足够过参数化,但添加过多参数会浪费训练资源。能否高效地找到最佳权衡?我们的工作表明,通过适当的条件化处理学习问题,双下降现象潜在可避免,但最终答案尚待发现。我们通过实证观察到,在复杂场景下借助适当正则化有望规避双下降,如简单的 正则化已对此视角产生积极作用。
引用
@article{arxiv.2302.13259,
title = {Can we avoid Double Descent in Deep Neural Networks?},
author = {Victor Quétu and Enzo Tartaglione},
journal= {arXiv preprint arXiv:2302.13259},
year = {2023}
}