面向深度 ReLU 网络的基于组件的 Sketching 方法
机器学习
2024-09-24 v1 统计理论
统计理论
摘要
深度学习在数据挖掘和人工智能领域产生了深远的影响,这得益于其在众多实际应用中的突破性成就以及创新的算法设计理念。然而,它饱受优化与泛化之间不一致问题的困扰,因为根据偏差-方差权衡原则,实现良好的泛化倾向于欠参数化网络,而确保基于梯度算法的有效收敛则需要过参数化网络。为了解决这个问题,我们针对各种任务开发了一种基于深度网络组件的新型 sketching 方案。具体而言,我们使用具有特定效能的深度网络组件来构建体现深度网络优势的 sketching 基。随后,我们基于构建的基将深度网络训练转化为线性经验风险最小化问题,成功避免了迭代算法复杂的收敛分析。通过理论分析和数值实验验证了所提出的基于组件的 sketching 方法的有效性。在理论上,我们证明了所提出的基于组件的 sketching 在浅层网络的饱和函数逼近中提供了几乎最优的速率,并且也实现了几乎最优的泛化误差界。在数值上,我们证明,与现有的基于梯度的训练方法相比,基于组件的 sketching 具有更优的泛化性能,同时降低了训练成本。
引用
@article{arxiv.2409.14174,
title = {Component-based Sketching for Deep ReLU Nets},
author = {Di Wang and Shao-Bo Lin and Deyu Meng and Feilong Cao},
journal= {arXiv preprint arXiv:2409.14174},
year = {2024}
}