中文

基于Sharkovsky定理的ReLU网络深度-宽度权衡

机器学习 2019-12-11 v1 动力系统 机器学习

摘要

理解深度神经网络(DNNs)的表征能力及其结构属性(如深度、宽度、激活单元类型)如何影响它们可计算的函数,一直是深度学习和逼近理论中一个重要且具有挑战性的问题。在一项开创性工作中,Telgarsky通过给出一类函数(基于简单三角波)突出了深度的优势:DNNs对这类函数可实现零分类误差,而节点数少于指数级的浅层网络则会产生常数误差。尽管Telgarsky的工作揭示了浅层神经网络的局限性,但它并未说明这些函数为何难以表征,事实上他将刻画那些无法被较小深度良好逼近的函数作为一个诱人的开放问题。在本工作中,我们指出DNNs表达性与动力系统Sharkovsky定理之间的一个新联系,使我们能够基于广义不动点概念(称为周期点,不动点为周期1点)的存在性,刻画ReLU网络表征函数时的深度-宽度权衡。受我们观察的启发——Telgarsky工作中使用的三角波包含周期3点,而基于Li-Yorke著名结果,该周期因暗示混沌行为而特殊——我们进一步给出表征周期函数所需宽度随深度变化的通用下界。从技术上讲,我们方法的关键在于对与此类函数相关联的动力系统进行特征值分析。

关键词

引用

@article{arxiv.1912.04378,
  title  = {Depth-Width Trade-offs for ReLU Networks via Sharkovsky's Theorem},
  author = {Vaggos Chatziafratis and Sai Ganesh Nagarajan and Ioannis Panageas and Xiao Wang},
  journal= {arXiv preprint arXiv:1912.04378},
  year   = {2019}
}