中文

无限宽多层感知机的更丰富先验

机器学习 2019-12-02 v1 机器学习

摘要

众所周知,在温和条件下,通过对多层感知机(MLP)参数施加零均值独立同分布(iid)先验所诱导的函数分布会收敛到高斯过程(GP)。我们首先将这一结果推广到具有一般零均值或非零均值的独立先验,其次推广到一类推广了 iid 先验的部分可交换先验。我们讨论了当考虑 MLP 中函数的等价类以及通过随机梯度下降等训练过程时,第二类先验如何自然产生。由部分可交换先验得到的模型是一个 GP,其额外具有一层推断意义,因为先验与后验预测分布需要对超参数进行边际化。我们推导了深度 MLP 中极限 GP 的核,并经验性地表明这些核避免了先前研究的先验中存在的某些病态。我们通过测量有限宽度模型与极限模型之间的最大均值差异,经验性地评估了我们的收敛性论断。我们在合成回归问题上将我们新的极限模型与一些先前讨论的模型进行了性能比较。我们观察到随着模型深度增加,边际似然与超后验的病态程度加剧,这与需要 notoriously 复杂优化技巧的有限宽度网络相呼应。

关键词

引用

@article{arxiv.1911.12927,
  title  = {Richer priors for infinitely wide multi-layer perceptrons},
  author = {Russell Tsuchida and Fred Roosta and Marcus Gallagher},
  journal= {arXiv preprint arXiv:1911.12927},
  year   = {2019}
}

备注

Pre-print