中文

神经网络的多速率训练

机器学习 2022-11-02 v4 机器学习

摘要

我们提出神经网络的多速率训练:将神经网络参数划分为在不同时间尺度上训练的“快”与“慢”部分,其中慢速部分更新频率更低。通过选择适当的划分,我们可以在迁移学习任务中获得显著的计算加速。我们针对视觉与自然语言处理(NLP)的应用表明,可在几乎一半的时间内微调深度神经网络,且不降低所得模型的泛化性能。我们分析了多速率方案的收敛性质,并与朴素 SGD 进行比较。我们还讨论了神经网络参数的划分选择,这些选择可在从头训练神经网络时增强泛化性能。多速率方法可用于学习数据中存在的不同特征,并作为一种正则化形式。我们的论文释放了将多速率技术用于神经网络训练的潜力,并为该领域的未来工作提供了若干起点。

关键词

引用

@article{arxiv.2106.10771,
  title  = {Multirate Training of Neural Networks},
  author = {Tiffany Vlaar and Benedict Leimkuhler},
  journal= {arXiv preprint arXiv:2106.10771},
  year   = {2022}
}

备注

Appeared in ICML 2022 (errata added on 19 Oct., 2022)