中文

通过训练导数避免多层感知机的过拟合

神经与进化计算 2019-10-29 v1

摘要

使用扩展反向传播算法训练的神经网络表现出对过拟合的抵抗能力。除目标值外,其代价函数还使用了最高至 4th4^{\mathrm{th}} 阶的导数。对于神经网络的常见应用,高阶导数不易获得,因此考虑更简单的情形:训练网络在 2D 和 5D 域内逼近解析函数,以及在 2D 圆内求解泊松方程。对于函数逼近,代价是输出与目标之间及其关于输入的导数的平方差之和。微分方程通常通过将多层感知机置于未知函数位置并训练其权重以使方程在某一误差范围内成立来求解。常用的代价是方程残差的平方。所增加的项是该残差关于自变量的导数的平方。为研究过拟合,在各种间距的正则网格点上最小化代价,并将其均方根与在更密集测试集上的值进行比较。具有六个隐藏层、总权重分别为 21042\cdot10^{4}11061\cdot10^{6}51065\cdot10^{6} 的全连接感知机用 Rprop 训练,直到代价在最后 1000 个 epoch 内变化小于 10%,或达到第 10000th10000^{\mathrm{th}} 个 epoch。用 51065\cdot10^{6} 个权重训练网络以表示简单 2D 函数,使用 10 个点且每个点带 8 个额外导数,产生的代价测试与训练之比为 1.51.5,而在可比条件下经典反向传播该比值为 21042\cdot10^{4}

关键词

引用

@article{arxiv.1802.10301,
  title  = {Avoiding overfitting of multilayer perceptrons by training derivatives},
  author = {V. I. Avrutskiy},
  journal= {arXiv preprint arXiv:1802.10301},
  year   = {2019}
}