中文

连续时间 dropout 的收敛性、设计与训练:一种随机小批量方法

机器学习 2025-10-16 v1 最优化与控制

摘要

我们通过随机小批量方法——这一系列最初用于降低交互式粒子系统计算成本的随机抽样方案——的视角,研究连续时间 dropout 的正则化。我们构建了一个无偏且 well-posed 的估计器,通过在长度为h的时间间隔内对神经元小批量进行采样来模拟 dropout。对于预期均匀误差,在h上的线性收敛率下建立了轨迹级收敛性。就分布层面,我们在轻微的矩假设下建立了连续性方程的稳定性,总变差误差为O(h^{1/2})。在固定小批量跨周期训练期间,基于 Pontryagin 的伴随分析界定了最优成本和控制、以及梯度下降迭代的偏差。就设计而言,我们比较了规范小批量抽样方案的收敛率,恢复了标准Bernoulli dropout 作为一种特殊情况,并导出一种 cost-accuracy trade-off,得到闭式最优h。我们随后针对单层神经ODE进行了专门化,并在分类和流匹配上验证了理论,观察到所预测的收敛率、正则化效应以及有利的运行时和内存配置。

关键词

引用

@article{arxiv.2510.13134,
  title  = {Convergence, design and training of continuous-time dropout as a random batch method},
  author = {Antonio Álvarez-López and Martín Hernández},
  journal= {arXiv preprint arXiv:2510.13134},
  year   = {2025}
}

备注

37 pages, 20 figures