中文

Langevin Monte-Carlo算法在任意规模和数据下学习深度二层神经网络

计算与语言 2025-03-18 v2

摘要

本文证明了Langevin蒙特卡洛算法能够学习任意规模、针对任何数据集的深度二层神经网络,并给出非渐近收敛速率。我们通过表明在q-Rényi散度中,Langevin蒙特卡洛的迭代收敛于Frobenius范数正则化损失的Gibbs分布,以上述任何网络实现,这在使用光滑激活函数且在分类和回归设置下均可实现。最关键的是,我们所需的正则化量与网络规模无关。这一结果综合了最近关于LMC在何处满足等高面条件的若干观察,以及二维神经网络损失函数可始终通过某种常数正则化来满足Villani条件,从而其Gibbs测度满足Poincaré不等式。

关键词

引用

@article{arxiv.2503.10427,
  title  = {VisTW: Benchmarking Vision-Language Models for Traditional Chinese in Taiwan},
  author = {Zhi Rui Tam and Ya-Ting Pai and Yen-Wei Lee and Yun-Nung Chen},
  journal= {arXiv preprint arXiv:2503.10427},
  year   = {2025}
}