从逐点到强力:用生成模型初始化神经网络
计算机视觉与模式识别
2023-10-26 v1 机器学习
摘要
传统初始化方法(如 He 和 Xavier)有效避免了神经网络中梯度消失或爆炸问题。然而,它们仅使用建模一维变量的简单逐点分布,且忽略关于架构的大部分信息并漠视过往训练经验。这些局限可通过采用生成模型进行初始化来克服。本文引入两组新初始化方法。首先,我们通过变分自编码器局部初始化权重组。其次,我们通过图超网络全局初始化完整权重集。我们透彻评估了所采用生成模型在准确率、收敛速度和集成方面对最先进神经网络的影响。结果表明,全局初始化带来更高准确率和更快初始收敛速度。但经由图超网络的实现导致在分布外数据上的集成性能下降。为抵消此影响,我们提出一种称为噪声图超网络的修改,其促进所产生集成成员的多样性。此外,我们的方法或能将学到的知识迁移至不同图像分布。我们的工作揭示了这些新初始化方法的潜力、权衡与可能修改。
引用
@article{arxiv.2310.16695,
title = {From Pointwise to Powerhouse: Initialising Neural Networks with Generative Models},
author = {Christian Harder and Moritz Fuchs and Yuri Tolkach and Anirban Mukhopadhyay},
journal= {arXiv preprint arXiv:2310.16695},
year = {2023}
}