更高效地估计宽随机多层感知器的预期输出
机器学习
2026-05-18 v2 无序系统与神经网络
机器学习
摘要
估计机器学习中预期损失的最常见方法是抽样、在每个样本上计算损失并取经验平均值。然而,抽样未必是最优方法。给定初始化时的多层感知器(MLP),我们展示了如何在不通过网络运行任何样本的情况下估计其对高斯输入的预期输出。相反,我们生成每层激活分布的近似表示,利用诸如累积量和 Hermite 展开等工具。我们在理论和实证上表明,对于足够宽的网络,估计器可在显著少于蒙特卡洛抽样的 FLOPs 下实现目标均方误差。我们进一步发现,方法在估计罕见事件概率方面表现尤佳,并且还演示了如何用于模型训练。综上,这些发现指向了显著降低模型发生灾难性尾部风险概率的路径。
引用
@article{arxiv.2605.05179,
title = {Estimating the expected output of wide random MLPs more efficiently than sampling},
author = {Wilson Wu and Victor Lecomte and Michael Winer and George Robinson and Jacob Hilton and Paul Christiano},
journal= {arXiv preprint arXiv:2605.05179},
year = {2026}
}
备注
68 pages. Code is available at https://github.com/alignment-research-center/mlp_cumulant_propagation