中文

基于超立方体拓扑覆盖的神经网络一次性训练构造方法

机器学习 2019-01-10 v1 机器学习

摘要

本文提出了一种利用几何方法训练深度神经网络的新型构造方法。我们证明拓扑覆盖可用于定义一类分布式线性矩阵不等式,其直接规定了神经网络架构的形状与深度。关键洞见在于线性矩阵不等式及其界定数据形状的能力,与现代神经网络中采用的修正线性单元(ReLU)激活函数之间的基本关系。我们表明,在覆盖构造学习中,单元覆盖几何与覆盖孔隙率是定义模型复杂度及所得神经网络分类器泛化能力的两个关键设计变量。在覆盖构造学习的语境下,这些发现凸显了模型复杂度与过拟合(由数据覆盖中元素数量量化)和测试数据泛化能力之间的古老权衡。最后,我们在 Iris、MNIST 和 Wine 数据集上对该算法进行基准测试,表明该构造算法能够一次性训练深度神经网络分类器,以更短训练时间取得相当或更高的训练与测试分类准确率。

关键词

引用

@article{arxiv.1901.02878,
  title  = {A Constructive Approach for One-Shot Training of Neural Networks Using Hypercube-Based Topological Coverings},
  author = {W. Brent Daniel and Enoch Yeung},
  journal= {arXiv preprint arXiv:1901.02878},
  year   = {2019}
}