中文

基于非线性控制理论的深度残差神经网络的万能逼近能力

机器学习 2024-02-12 v4 系统与控制 系统与控制 最优化与控制 机器学习

摘要

本文通过几何非线性控制解释了深度残差神经网络的万能逼近能力。受近期建立残差网络与控制系统之间联系的工作启发,我们为残差网络具有万能逼近能力提供了一个充分条件,即要求激活函数或其某个导数满足一个二次微分方程。实践中使用的许多激活函数都精确或近似地满足这一假设,并且我们证明了该性质足以使一个每层具有 n+1n+1 个神经元的足够深的神经网络,在一个紧集上以一致范数任意好地逼近任何从 Rn\mathbb{R}^nRn\mathbb{R}^n 的连续函数。我们进一步表明,该结果对于非常简单的架构同样成立,其权重仅需取两个值。第一个关键技术贡献在于,将万能逼近问题与残差网络对应的控制系统系综的能控性联系起来,并利用经典的李代数技术来表征能控性。第二个技术贡献是识别出单调性,将其作为有限系综能控性与紧集上一致可逼近性之间的桥梁。

关键词

引用

@article{arxiv.2007.06007,
  title  = {Universal Approximation Power of Deep Residual Neural Networks via Nonlinear Control Theory},
  author = {Paulo Tabuada and Bahman Gharesifard},
  journal= {arXiv preprint arXiv:2007.06007},
  year   = {2024}
}

备注

Sejun Park and Geonho Hwang brought to our atention a mistake in the proof of Theorem 5.1. This mistake is corrected in this version with the consequence of increasing the number of neurons per layer from n+1 to 2n+1