中文

神经网络训练的最小作用量原理

机器学习 2021-06-16 v4 机器学习

摘要

尽管高度过参数化,神经网络在许多任务上仍取得了很高的泛化性能。由于经典统计学习理论难以解释这种行为,近期大量工作聚焦于揭示其背后的机制,以期发展更充分的理论框架并更好地控制训练后的模型。在本工作中,我们采用一种替代视角,将神经网络视为随时间推移位移输入粒子的动力系统。我们进行了一系列实验,并通过分析网络的位移行为,展示了网络的传输映射中存在低动能位移偏置,并将该偏置与泛化性能联系起来。基于这一观察,我们重新表述学习问题如下:寻找在解决任务的同时尽可能高效地传输数据的神经网络。这提供了一种新颖的学习问题表述,使我们能够基于最优传输理论给出解网络的正则性结果。从实践角度看,这使我们能够提出一种新的学习算法,其自动适应给定任务的复杂度,并即使在低数据情形下也能得到具有高泛化能力的网络。

关键词

引用

@article{arxiv.2009.08372,
  title  = {A Principle of Least Action for the Training of Neural Networks},
  author = {Skander Karkar and Ibrahim Ayed and Emmanuel de Bézenac and Patrick Gallinari},
  journal= {arXiv preprint arXiv:2009.08372},
  year   = {2021}
}

备注

ECML PKDD 2020