深度神经网络的智能梯度放大
机器学习
2023-05-31 v1 计算机视觉与模式识别
摘要
与其他机器学习技术相比,深度学习模型在多种任务和领域上提供了更优的性能,但也带来了自身的挑战。特别地,深度学习模型随着模型深度增加需要更长的训练时间,并且遭受梯度消失问题。若干解决方案独立地解决这些问题,但极少有努力去确定一种集成方案,通过解决梯度消失问题来提升模型性能,并加速训练过程以在更大学习率下实现更高性能。在本工作中,我们使用一种分析训练期间各层梯度波动的公式化方法,智能地确定深度模型中的哪些层应用梯度放大。针对更浅和更深的神经网络,使用两种不同的智能度量和两种不同的阈值来确定放大层,并采用仅在特定轮次放大梯度的训练策略,进行了详细实验。结果表明,即使在更高学习率下训练模型,我们的放大相比原始模型提供了更好的性能,并在 CIFAR-10 和 CIFAR-100 数据集上分别实现了约 2.5% 和约 4.5% 的准确率提升。
引用
@article{arxiv.2305.18445,
title = {Intelligent gradient amplification for deep neural networks},
author = {Sunitha Basodi and Krishna Pusuluri and Xueli Xiao and Yi Pan},
journal= {arXiv preprint arXiv:2305.18445},
year = {2023}
}