神经网络训练过程的 Ergodic 定理描述:幽灵节点
机器学习
2025-07-15 v3 人工智能
摘要
最近的研究提出了从 Ergodic 视角解释训练过程的方法。基于这一基础,我们提出了一种统一框架,用于通过随机梯度下降 (SGD) 理解和加速深度神经网络的训练。通过分析目标函数的几何景观,我们引入了一种实用诊断工具——最大 Lyapunov 指数的运行估计值,该指数可证实区分 genuine 收敛至稳定极小值与仅靠统计手段在鞍点附近稳定。我们然后提出了一种针对标准分类器的幽灵类别扩展,添加辅助幽灵输出节点,以便模型获得额外的下山方向,这些方向在狭窄损失障碍周围开辟出横向走廊,使优化器能够在训练早期阶段绕过差坡。我们证明该扩展严格降低了近似误差,并且在充分收敛后,幽灵维度会坍缩,使扩展模型与原始模型一致,且在扩大参数空间中存在一条总损失不增的路径。综上,这些结果提供了一种以架构层面进行的原则性干预,既加速了早期训练可行性,又保持了渐近行为,同时充当一种架构友好的正则化器。
引用
@article{arxiv.2507.01003,
title = {Description of the Training Process of Neural Networks via Ergodic Theorem : Ghost nodes},
author = {Eun-Ji Park and Sangwon Yun},
journal= {arXiv preprint arXiv:2507.01003},
year = {2025}
}
备注
16 pages, 9 figures