LayerDropBack:加速深层网络训练的通用方法
计算机视觉与模式识别
2024-12-25 v1
摘要
训练非常深的卷积网络具有挑战性,需要大量计算资源和时间。现有的加速方法通常取决于特定的体系结构或需要网络修改。我们引入LayerDropBack(LDB),一种简单而有效的方法,可加速跨广泛范围的深层网络的训练。LDB仅在反向传递中引入随机性,保持前向传递的完整性,保证在训练和推理期间使用相同的网络。LDB可以无缝集成到任何模型的训练过程中,而无需更改其体系结构,因而适用于各种网络拓扑。我们的广泛实验覆盖多个体系结构(ViT、Swin Transformer、EfficientNet、DLA)和数据集(CIFAR-100、ImageNet),显示出训练时间缩短16.93%至23.97%,同时保持或甚至提高模型准确性。代码可在\url{https://github.com/neiterman21/LDB}获取。
关键词
引用
@article{arxiv.2412.18027,
title = {LayerDropBack: A Universally Applicable Approach for Accelerating Training of Deep Networks},
author = {Evgeny Hershkovitch Neiterman and Gil Ben-Artzi},
journal= {arXiv preprint arXiv:2412.18027},
year = {2024}
}