中文

面向内存高效设备端深度神经网络训练的梯度低秩近似

音频与语音处理 2020-01-27 v1 机器学习 声音 机器学习

摘要

在移动设备上训练机器学习模型有潜力提升模型的隐私性和准确性。然而,实现这一目标的主要障碍之一是移动设备的内存限制。降低训练内存使得具有高维权重矩阵的模型(如自动语音识别(ASR)模型)能够在设备端训练。在本文中,我们提出使用低秩参数化来近似深度神经网络的梯度矩阵,以作为节省训练内存的一种途径。低秩梯度近似使得更先进、内存密集的优化技术能够在设备上运行。我们的实验结果表明,对于 Adam 优化,我们可以将训练内存降低约 33.0%。其使用的内存与动量优化相当,并在一项 ASR 个性化任务上取得了相对低 4.5% 的词错误率。

关键词

引用

@article{arxiv.2001.08885,
  title  = {Low-rank Gradient Approximation For Memory-Efficient On-device Training of Deep Neural Network},
  author = {Mary Gooneratne and Khe Chai Sim and Petr Zadrazil and Andreas Kabel and Françoise Beaufays and Giovanni Motta},
  journal= {arXiv preprint arXiv:2001.08885},
  year   = {2020}
}