加速深度学习训练并提升鲁棒性的乘法更新规则
机器学习
2024-08-22 v1 人工智能
摘要
即便在如今深度学习(DL)已在广泛研究领域中取得最先进性能的情况下,加速训练与构建鲁棒 DL 模型仍是一项挑战性任务。为此,一代代研究者致力于开发用于训练 DL 架构的鲁棒方法,使其对权重分布、模型架构与损失景观较不敏感。然而,此类方法局限于自适应学习率优化器、初始化方案与梯度裁剪,而未探究参数更新的基本规则。尽管乘法更新在早期机器学习发展中贡献显著且具备强有力的理论依据,但据我们所知,这是首项在 DL 训练加速与鲁棒性背景下对其展开研究的工作。本工作中,我们提出一个适配广泛优化算法并支持应用替代更新规则的优化框架。为此,我们提出一种新颖的乘法更新规则,并在一种新颖的混合更新方法下将其与传统加性更新项结合以扩展其能力。我们主张所提框架可加速训练,同时相较传统使用的加性更新规则带来更鲁棒的模型,并通过广泛任务与优化方法上的实验证明了其有效性。此类任务涵盖从凸与非凸优化到困难图像分类基准,应用了多种传统使用的优化方法与深度神经网络(DNN)架构。
引用
@article{arxiv.2307.07189,
title = {Multiplicative update rules for accelerating deep learning training and increasing robustness},
author = {Manos Kirtas and Nikolaos Passalis and Anastasios Tefas},
journal= {arXiv preprint arXiv:2307.07189},
year = {2024}
}