中文

硬件兼容扰动训练算法的规模化

机器学习 2025-05-01 v1 神经与进化计算 最优化与控制

摘要

在本工作中,我们探讨了 multiplexed gradient descent (MGD) 的能力,这是一种用于估计损失函数梯度的可扩展且高效的硬件零阶训练方法,通过随机梯度下降进行训练。我们将该框架扩展以包括权重和节点扰动,并讨论了每种方法的优缺点。我们将 MGD 用于训练网络的时间作为网络规模和任务复杂度的函数进行了调查。以前的研究表明,扰动训练方法在大规模问题上不会很好地扩展,因为在这些方法中,估计梯度的时间随网络参数数量成线性增长。然而,在本工作中,我们显示,达到目标准确度的时间——即实际解决我们感兴趣的问题的时间——并不遵循这种不令人满意的线性规模化,甚至往往会随网络规模而减小。此外,我们演示了 MGD 可用于计算随机梯度下降中梯度的即插即用替换,因此优化加速器如动量可与 MGD 一起使用,确保与现有机器学习实践的兼容性。我们的结果表明,MGD 能够在硬件上高效训练大型网络,实现与反向传播相当的准确度,从而为未来的神经形态计算系统提供了实用解决方案。

关键词

引用

@article{arxiv.2501.15403,
  title  = {Scaling of hardware-compatible perturbative training algorithms},
  author = {Bakhrom G. Oripov and Andrew Dienstfrey and Adam N. McCaughan and Sonia M. Buckley},
  journal= {arXiv preprint arXiv:2501.15403},
  year   = {2025}
}