中文

通过涌现促进初始化方案提升神经网络性能

机器学习 2025-01-07 v3 计算机视觉与模式识别

摘要

机器学习中的涌现指从训练数据和模型结构的规模与结构中,尽管未被显式编程,却自然出现复杂行为或能力。我们引入一种新颖且简单易行的神经网络初始化方案,旨在实现更大的涌现潜力。通过衡量涌现作为一种结构非线性来衡量,我们的方法调整各层的权重缩放因子,以实现更高的涌现值。这种增强措施容易实施,无需额外的优化步骤即可完成初始化,类似于 GradInit。我们在各种网络架构上进行评估,包括用于图像识别的 MLP 和卷积网络,以及用于机器翻译的 Transformer。我们展示了在有无批量归一化情况下,本方法在模型准确率和训练速度方面都有显著的改进。该方法的简单性、理论创新性以及显著的实证优势使其成为神经网络初始化实践的强有力的增强。这些结果表明,利用涌现来改进神经网络训练方法的前景广阔。代码已公开:https://github.com/johnnyjingzeli/EmergenceInit。

关键词

引用

@article{arxiv.2407.19044,
  title  = {Advancing Neural Network Performance through Emergence-Promoting Initialization Scheme},
  author = {Johnny Jingze Li and Vivek Kurien George and Gabriel A. Silva},
  journal= {arXiv preprint arXiv:2407.19044},
  year   = {2025}
}