均值方差估计神经网络的最优训练
机器学习
2023-08-04 v2 机器学习
摘要
本文关注均值方差估计网络(MVE 网络)(Nix and Weigend, 1994)的最优实现。这类网络常作为回归设定中不确定性估计方法的构建模块,例如 Concrete dropout(Gal et al., 2017)与 Deep Ensembles(Lakshminarayanan et al., 2017)。具体而言,MVE 网络假设数据由具有均值函数与方差函数的正态分布生成。MVE 网络输出均值与方差估计,并通过最小化负对数似然来优化网络参数。在本文中,我们提出两个重要见解。首先,近期工作中报告的收敛困难可通过遵循原作者的简单却常被忽视的建议而较易避免,即应使用预热期。在此期间,仅以固定方差优化均值。我们通过实验证明了该步骤的有效性,强调其应成为标准做法。作为旁注,我们考察在预热后固定均值而仅优化方差,还是同时优化两者更有利。在此我们未观察到显著差异。其次,我们引入 MVE 网络的一种新颖改进:对均值与方差估计分别正则化。我们在玩具示例及若干 UCI 基准回归数据集上证明,遵循原始建议与新颖的分别正则化可带来显著改进。
引用
@article{arxiv.2302.08875,
title = {Optimal Training of Mean Variance Estimation Neural Networks},
author = {Laurens Sluijterman and Eric Cator and Tom Heskes},
journal= {arXiv preprint arXiv:2302.08875},
year = {2023}
}
备注
11 pages, 7 figures