中文

一种用于计算深度神经网络正则化路径的多目标延拓方法

机器学习 2024-04-01 v5 人工智能 最优化与控制 机器学习

摘要

稀疏性是深度神经网络(DNNs)非常期望具备的特性,因为它能保证数值效率、提升模型可解释性(由于相关特征数量更少)以及鲁棒性。对于线性模型,众所周知存在一条正则化路径,连接按1\ell^1范数最稀疏的解(即零权重)与非正则化解。最近,首次尝试通过将经验损失与稀疏性(1\ell^1范数)视为两个冲突准则,并针对低维DNN求解所得多目标优化问题,将正则化路径的概念推广至DNN。然而,由于1\ell^1范数的非光滑性以及参数量巨大,该方法从计算角度对高维DNN效率不高。为克服此局限,我们提出一种算法,能够以极高效率近似上述目标在具有数百万参数的高维DNN上的整个帕累托前沿。我们给出了使用确定性与随机梯度的数值示例。我们进一步证明,对正则化路径的了解有助于获得泛化性能良好的网络参数化。据我们所知,这是首个针对具有数百万自由度的非凸多目标优化问题(MOPs)计算正则化路径的算法。

关键词

引用

@article{arxiv.2308.12044,
  title  = {A multiobjective continuation method to compute the regularization path of deep neural networks},
  author = {Augustina C. Amakor and Konstantin Sonntag and Sebastian Peitz},
  journal= {arXiv preprint arXiv:2308.12044},
  year   = {2024}
}

备注

7 pages, 6 figures