深入审视深度学习启发式方法:学习率重启、预热与蒸馏
机器学习
2018-11-01 v1 机器学习
摘要
常见深度学习模型的收敛速度与最终性能已显著受益于学习率调度、知识蒸馏、跳跃连接和归一化层等启发式方法。在缺乏理论支撑的情况下,旨在解释这些策略的受控实验有助于我们理解深度学习损失景观与训练动态。现有的实证分析方法依赖于线性插值与降维可视化工具,二者各有局限。相反,我们通过近期提出的损失曲面与表示分析方法(即模式连通性(mode connectivity)与典型相关分析(CCA))重新审视此类启发式方法的分析,并假设这些启发式方法成功的原因。具体而言,我们利用模式连通性与CCA探究知识蒸馏以及(余弦)重启与预热的学习率启发式方法。我们的实证分析表明:(a) 余弦退火常被引述的成功原因在实践中并无证据支持;(b) 学习率预热的作用在于防止深层网络产生训练不稳定性;以及 (c) 教师模型共享的潜在知识主要被分配至深层网络。
引用
@article{arxiv.1810.13243,
title = {A Closer Look at Deep Learning Heuristics: Learning rate restarts, Warmup and Distillation},
author = {Akhilesh Gotmare and Nitish Shirish Keskar and Caiming Xiong and Richard Socher},
journal= {arXiv preprint arXiv:1810.13243},
year = {2018}
}
备注
We use empirical tools of mode connectivity and SVCCA to investigate neural network training heuristics of learning rate restarts, warmup and knowledge distillation. arXiv admin note: text overlap with arXiv:1806.06977