通过动力系统洞察实现超参数无关的 DNN 训练
机器学习
2023-10-24 v1 系统与控制
系统与控制
摘要
我们提出一种专为深度神经网络(DNNs)设计的随机一阶优化方法 ECCO-DNN。该方法将优化变量轨迹建模为动力系统,并开发了一种基于轨迹形状自适应选择步长的离散化算法。这带来两个关键洞察:为快速连续时间收敛设计动力系统,以及基于数值积分与神经网络结构原理开发自适应选择步长的时间步进算法。由此得到的优化器性能对超参数变化不敏感,且达到与包括 ADAM、SGD、RMSProp 和 AdaGrad 在内的前沿优化器相当的性能。我们在 DNN 模型与数据集(包括使用 ECCO-DNN 的 CIFAR-10 与 CIFAR-100)训练中展示了这一点,并发现 ECCO-DNN 的单一超参数改变三个数量级也不影响训练模型的精度。ECCO-DNN 的不敏感性降低超参数调优所需的数据与计算,使其利于快速原型开发及面向新数据集的应用。为验证所提优化器的效能,我们使用 ECCO-DNN 在 household power consumption 数据集上训练 LSTM 架构,并在无需调参下取得最优均方误差。
引用
@article{arxiv.2310.13901,
title = {Towards Hyperparameter-Agnostic DNN Training via Dynamical System Insights},
author = {Carmel Fiscko and Aayushya Agarwal and Yihan Ruan and Soummya Kar and Larry Pileggi and Bruno Sinopoli},
journal= {arXiv preprint arXiv:2310.13901},
year = {2023}
}
备注
25 pages, 11 figures