中文

基于核流对神经网络内层进行深度正则化与直接训练

机器学习 2021-08-25 v2 机器学习

摘要

我们提出一种基于核流(Kernel Flows, KFs)的人工神经网络(ANNs)新正则化方法。KFs 作为一种核选择方法被引入回归/克里金中,其基于随机数据批次中插值点数量减半所导致的精度损失最小化。将 ANN 的组合结构写为函数表示 fθ(x)=(fθn(n)fθn1(n1)fθ1(1))(x)f_\theta(x) = \big(f^{(n)}_{\theta_n}\circ f^{(n-1)}_{\theta_{n-1}} \circ \dots \circ f^{(1)}_{\theta_1}\big)(x),内层输出 h(i)(x)=(fθi(i)fθi1(i1)fθ1(1))(x)h^{(i)}(x) = \big(f^{(i)}_{\theta_i}\circ f^{(i-1)}_{\theta_{i-1}} \circ \dots \circ f^{(1)}_{\theta_1}\big)(x) 定义了一组特征映射与核 k(i)(x,x)=exp(γih(i)(x)h(i)(x)22)k^{(i)}(x,x')=\exp(- \gamma_i \|h^{(i)}(x)-h^{(i)}(x')\|_2^2)。当与数据批次结合时,这些核产生 KF 损失 e2(i)e_2^{(i)}(使用随机一半批次预测另一半所带来的 L2L^2 回归误差),其依赖于内层参数 θ1,,θi\theta_1,\ldots,\theta_i(以及 γi\gamma_i)。所提方法仅将这些 KF 损失的一个子集与经典输出损失聚合。我们在 CNNs 和 WRNs 上测试了所提方法,未改变网络结构及输出分类器,并报告了测试误差降低、泛化差距减小以及在分布偏移下鲁棒性增强,且计算复杂度无显著增加。我们推测,这些结果可解释为:传统训练仅采用由数据集定义的经验分布的线性泛函(广义矩),且易陷入神经切线核(Neural Tangent Kernel)机制(在过参数化下),而所提损失函数(定义为经验分布的非线性泛函)有效地训练了 CNN 所定义的底层核,而非仅用该核回归数据。

关键词

引用

@article{arxiv.2002.08335,
  title  = {Deep regularization and direct training of the inner layers of Neural Networks with Kernel Flows},
  author = {Gene Ryan Yoo and Houman Owhadi},
  journal= {arXiv preprint arXiv:2002.08335},
  year   = {2021}
}