神经网络内部对称性的统一:Transformer、前馈与 Neural ODE
机器学习
2024-02-06 v1 人工智能
高能物理 - 理论
计算物理
摘要
理解神经网络(包括 Transformer)的内部工作原理仍然是机器学习中最具挑战性的难题之一。本研究引入了一种新方法,将物理学中的关键概念——规范对称性原理应用于神经网络架构。通过将模型函数视为物理可观测量,我们发现各种机器学习模型的参数冗余可以解释为规范对称性。我们在数学上表述了 Neural ODE 中的参数冗余,并发现其规范对称性由时空微分同胚给出,后者在爱因斯坦引力理论中扮演着基础角色。将 Neural ODE 视为前馈神经网络的连续版本,我们表明前馈神经网络中的参数冗余确实被提升为 Neural ODE 中的微分同胚。我们进一步将分析扩展到 Transformer 模型,发现了其与 Neural ODE 及其规范对称性的自然对应关系。规范对称性的概念通过物理学为深度学习模型的复杂行为提供了启示,并为我们提供了分析各种机器学习架构的统一视角。
引用
@article{arxiv.2402.02362,
title = {Unification of Symmetries Inside Neural Networks: Transformer, Feedforward and Neural ODE},
author = {Koji Hashimoto and Yuji Hirono and Akiyoshi Sannai},
journal= {arXiv preprint arXiv:2402.02362},
year = {2024}
}
备注
11 pages, 3 figures