中文

条件高斯向量的熵下界及其对神经网络的应用

概率论 2025-06-04 v2 人工智能 机器学习 机器学习

摘要

我们利用信息论中的熵不等式,提供了关于条件高斯分布与具有可逆协方差矩阵的高斯分布之间总变差距离和 2- Wasserstein 距离的新型下界。我们将结果应用于量化随机初始化的全连接神经网络及其导数 - 在有限数量的输入上评估 - 当初始化为高斯分布且内部层大小趋于无穷大时,其收敛到高斯分布的速度。我们的结果对激活函数具有温和的假设限制,能够恢复各种距离度量下的最优收�敛率,从而改进和扩展了 Basteri 和 Trevisan (2023)、Favaro 等 (2023)、Trevisan (2024) 和 Apollonio 等 (2024) 的发现。我们主要工具之一是 Hanin (2024) 建立的定量累积量估计。作为示例,我们将结果应用于界定贝叶斯后验分布 - 神经网络及其导数 - 与相应高斯极限的后验分布之间的总变差距离:这给出 Hron 等 (2022) 后验中心极限定理的定量版本,并将 Trevisan (2024) 的若干估计推广到总变差度量。

关键词

引用

@article{arxiv.2504.08335,
  title  = {Entropic bounds for conditionally Gaussian vectors and applications to neural networks},
  author = {Lucia Celli and Giovanni Peccati},
  journal= {arXiv preprint arXiv:2504.08335},
  year   = {2025}
}