中文

神经网络的 LU 分解与 Toeplitz 分解

机器学习 2022-11-28 v1 数值分析 数值分析

摘要

众所周知任意矩阵 AA 都有 LU 分解。较少为人所知的是它还有一个“Toeplitz 分解” A=T1T2TrA = T_1 T_2 \cdots T_r,其中 TiT_i 为 Toeplitz 矩阵。我们将证明任意连续函数 f:RnRmf : \mathbb{R}^n \to \mathbb{R}^m 都可由形如 L1σ1U1σ2L2σ3U2Lrσ2r1UrL_1 \sigma_1 U_1 \sigma_2 L_2 \sigma_3 U_2 \cdots L_r \sigma_{2r-1} U_r 的神经网络任意精度逼近,即权重矩阵在下三角与上三角矩阵之间交替,σi(x):=σ(xbi)\sigma_i(x) := \sigma(x - b_i) 对某个偏置向量 bib_i 成立,且激活函数 σ\sigma 基本上可取任意一致连续非多项式函数。同样结果对 Toeplitz 矩阵也成立,即 fT1σ1T2σ2σr1Trf \approx T_1 \sigma_1 T_2 \sigma_2 \cdots \sigma_{r-1} T_r 可任意精度逼近,对 Hankel 矩阵亦然。我们 Toeplitz 结果的一个推论是卷积神经网络的定宽通用逼近定理,迄今此类网络仅有任意宽版本。由于我们的结果尤其适用于 ff 为一般神经网络的情形,可将其视为神经网络的 LU 与 Toeplitz 分解。我们结果的实践意义在于:可在不损失通用逼近能力的前提下大幅减少神经网络权重参数数量。我们将展示若干真实数据集上的实验,表明对权重矩阵施加此类结构可急剧减少训练参数,而对测试精度几乎无可见影响。

关键词

引用

@article{arxiv.2211.13935,
  title  = {LU decomposition and Toeplitz decomposition of a neural network},
  author = {Yucong Liu and Simiao Jiao and Lek-Heng Lim},
  journal= {arXiv preprint arXiv:2211.13935},
  year   = {2022}
}

备注

14 pages, 3 figures