中文

基于物理的神经网络深度学习理论

机器学习 2021-04-27 v2

摘要

在过去十年中,深度学习已成为人工智能的主要组成部分。深度学习的驱动力是用随机梯度下降(SGD)优化损失函数。传统上在深度学习中,神经网络是可微分的数学函数,SGD所需的损失梯度由反向传播算法计算。然而,实现和训练这些神经网络的计算机架构由于存储与处理分离而存在速度和能效低下的问题。为解决这些问题,神经形态计算领域旨在将神经网络实现于融合存储与处理的硬件架构上,正如大脑那样。在本文中,我们认为在神经形态架构上构建大型、快速且高效的神经网络也需要重新思考实现和训练它们的算法。我们提出了一个同样兼容SGD的替代数学框架,其提供了在直接利用物理定律的基底上设计神经网络的可能性。我们的框架适用于非常广泛的一类模型,即那些状态或动力学由变分方程描述的模型。这包括平衡态使能量函数最小的物理系统,以及轨迹使作用量泛函最小的物理系统。我们给出了在这类系统中计算损失梯度的简单步骤,称为平衡传播(EqProp),它仅需要每个可训练参数的局部可用信息。由于物理与工程中的许多模型可用变分原理描述,我们的框架有潜力应用于广泛的物理系统,其应用超越神经形态计算而扩展到工程各领域。

关键词

引用

@article{arxiv.2103.09985,
  title  = {A deep learning theory for neural networks grounded in physics},
  author = {Benjamin Scellier},
  journal= {arXiv preprint arXiv:2103.09985},
  year   = {2021}
}