中文

神经网络训练过程的 Ergodic 定理描述:幽灵节点

机器学习 2025-07-15 v3 人工智能

摘要

最近的研究提出了从 Ergodic 视角解释训练过程的方法。基于这一基础,我们提出了一种统一框架,用于通过随机梯度下降 (SGD) 理解和加速深度神经网络的训练。通过分析目标函数的几何景观,我们引入了一种实用诊断工具——最大 Lyapunov 指数的运行估计值,该指数可证实区分 genuine 收敛至稳定极小值与仅靠统计手段在鞍点附近稳定。我们然后提出了一种针对标准分类器的幽灵类别扩展,添加辅助幽灵输出节点,以便模型获得额外的下山方向,这些方向在狭窄损失障碍周围开辟出横向走廊,使优化器能够在训练早期阶段绕过差坡。我们证明该扩展严格降低了近似误差,并且在充分收敛后,幽灵维度会坍缩,使扩展模型与原始模型一致,且在扩大参数空间中存在一条总损失不增的路径。综上,这些结果提供了一种以架构层面进行的原则性干预,既加速了早期训练可行性,又保持了渐近行为,同时充当一种架构友好的正则化器。

关键词

引用

@article{arxiv.2507.01003,
  title  = {Description of the Training Process of Neural Networks via Ergodic Theorem : Ghost nodes},
  author = {Eun-Ji Park and Sangwon Yun},
  journal= {arXiv preprint arXiv:2507.01003},
  year   = {2025}
}

备注

16 pages, 9 figures