探索深度神经网络的低秩训练
机器学习
2022-09-28 v1 机器学习
摘要
以低秩方式(即使用分解层)训练深度神经网络引起了社区的特别关注:它在内存消耗和训练时间方面相比未分解训练都具有高效性。先前的工作集中于预训练网络的低秩近似以及在低秩空间中借助附加目标进行训练,为所采用的做法提供了各种临时的解释。我们分析了在实践中效果良好的技术,并通过对 GPT2 等模型的大量消融实验,提供了证伪该领域常见信念的证据,在此过程中暗示了仍待解决的令人兴奋的研究机会。
引用
@article{arxiv.2209.13569,
title = {Exploring Low Rank Training of Deep Neural Networks},
author = {Siddhartha Rao Kamalakara and Acyr Locatelli and Bharat Venkitesh and Jimmy Ba and Yarin Gal and Aidan N. Gomez},
journal= {arXiv preprint arXiv:2209.13569},
year = {2022}
}