复用梯度下降:在无反向传播的硬件神经网络上快速在线训练现代数据集
机器学习
2023-08-17 v1 神经与进化计算
摘要
我们提出复用梯度下降(MGD),一种为在硬件上轻松训练模拟或数字神经网络而设计的梯度下降框架。MGD利用零阶优化技术对硬件神经网络进行在线训练。我们展示了其在现代机器学习数据集(包括CIFAR-10和Fashion-MNIST)上训练神经网络的能力,并将其性能与反向传播进行比较。在假设现实的时间尺度和硬件参数的情况下,我们的结果表明,即使在存在不完美的权重更新或硬件中器件间差异的情况下,这些优化技术也能在新兴硬件平台上以比标准GPU上通过反向传播的训练墙钟时间快数个数量级的速度训练网络。我们还描述了如何将其作为循环内芯片训练的一部分应用于现有硬件,或直接集成在硬件层面。关键在于,MGD框架具有高度灵活性,其梯度下降过程可被优化以补偿特定的硬件限制,例如缓慢的参数更新速度或有限的输入带宽。
引用
@article{arxiv.2303.03986,
title = {Multiplexed gradient descent: Fast online training of modern datasets on hardware neural networks without backpropagation},
author = {Adam N. McCaughan and Bakhrom G. Oripov and Natesh Ganesh and Sae Woo Nam and Andrew Dienstfrey and Sonia M. Buckley},
journal= {arXiv preprint arXiv:2303.03986},
year = {2023}
}