AutoInit:面向神经网络的解析保信号权重初始化方法
机器学习
2022-12-01 v2
摘要
神经网络需要谨慎的权重初始化,以防止信号爆炸或消失。现有的初始化方案通过假设网络具有特定激活函数或拓扑结构,在特定情况下解决了该问题。此类权重初始化策略难以推导,因此现代架构常沿用这些方案,即便其假设并不成立。本文提出 AutoInit,一种自动适应不同神经网络架构的权重初始化算法。通过解析地追踪信号在网络中传播时的均值与方差,AutoInit 在每一层对权重进行适当缩放,以避免信号爆炸或消失。实验表明,在一系列激活函数、dropout、权重衰减、学习率和归一化器设置下,AutoInit 比数据相关初始化方法更可靠地提升了卷积网络、残差网络和 transformer 网络的性能。这种灵活性使 AutoInit 能够从小型表格任务到 ImageNet 等大型数据集的模型初始化。这种通用性在神经架构搜索和激活函数发现中尤为有用。在这些场景中,AutoInit 恰当地初始化每个候选,使性能评估更准确。因此,AutoInit 作为一种自动配置工具,使新神经网络架构的设计更为稳健。AutoInit 包提供了对 TensorFlow 模型的封装,可从 https://github.com/cognizant-ai-labs/autoinit 获取。
引用
@article{arxiv.2109.08958,
title = {AutoInit: Analytic Signal-Preserving Weight Initialization for Neural Networks},
author = {Garrett Bingham and Risto Miikkulainen},
journal= {arXiv preprint arXiv:2109.08958},
year = {2022}
}
备注
To appear in AAAI 2023. 19 pages, 10 figures, 3 tables