深度架构连通性关乎其收敛性:一项细粒度分析
机器学习
2022-10-13 v2
摘要
由人工或 AutoML 算法设计的先进深度神经网络(DNNs)正变得日益复杂。多样的操作通过复杂的连通模式(例如各类跳跃连接)相连。这些拓扑结构在经验上有效,且被观察到普遍能平滑损失景观并促进梯度流动。然而,要推导其对 DNN 容量或可训练性影响的原则性理解,并弄清为何或在哪方面某种特定连通模式优于另一种,仍不明晰。本工作中,我们从细粒度上理论刻画了梯度下降训练下连通模式对 DNN 收敛的影响。通过分析宽网络的神经网络高斯过程(NNGP),我们能够刻画 NNGP 核的谱如何通过特定连通模式传播,以及这如何影响收敛速率的界。作为我们结果的一个实际启示,我们展示通过对“无前景”的连通模式进行简单过滤,可减少待评估模型数量,并在无额外开销下显著加速大规模神经架构搜索。代码见:https://github.com/VITA-Group/architecture_convergence。
引用
@article{arxiv.2205.05662,
title = {Deep Architecture Connectivity Matters for Its Convergence: A Fine-Grained Analysis},
author = {Wuyang Chen and Wei Huang and Xinyu Gong and Boris Hanin and Zhangyang Wang},
journal= {arXiv preprint arXiv:2205.05662},
year = {2022}
}
备注
Neurips 2022 accepted