Langevin Monte-Carlo算法在任意规模和数据下学习深度二层神经网络
计算与语言
2025-03-18 v2
摘要
本文证明了Langevin蒙特卡洛算法能够学习任意规模、针对任何数据集的深度二层神经网络,并给出非渐近收敛速率。我们通过表明在q-Rényi散度中,Langevin蒙特卡洛的迭代收敛于Frobenius范数正则化损失的Gibbs分布,以上述任何网络实现,这在使用光滑激活函数且在分类和回归设置下均可实现。最关键的是,我们所需的正则化量与网络规模无关。这一结果综合了最近关于LMC在何处满足等高面条件的若干观察,以及二维神经网络损失函数可始终通过某种常数正则化来满足Villani条件,从而其Gibbs测度满足Poincaré不等式。
引用
@article{arxiv.2503.10427,
title = {VisTW: Benchmarking Vision-Language Models for Traditional Chinese in Taiwan},
author = {Zhi Rui Tam and Ya-Ting Pai and Yen-Wei Lee and Yun-Nung Chen},
journal= {arXiv preprint arXiv:2503.10427},
year = {2025}
}