中文

煨炖法:训练神经网络时“足够好”优于“最优”

机器学习 2026-02-20 v2 人工智能

摘要

大量神经网络训练技术虽调用优化,却依赖临时修改才能保证有效性,这表明基于优化的训练方法存在根本性缺陷。过拟合问题尤其凸显了基于优化训练的不足,因为朴素的优化会产生虚假的结果。神经网络在物理过程建模方面的广泛成功,催生了一种反向研究思路的进展,即将神经网络本身视为物理系统。这些成功引发了一个问题:更广泛的物理视角是否能推动构建新的训练方法。在此,我们引入“煨炖法”(simmering),这是一种基于物理的方法,它训练神经网络生成的权重和偏置仅仅是“足够好”,但矛盾的是,其性能却优于领先的基于优化的方法。通过分类和回归示例,我们表明煨炖法能够纠正被 Adam 过拟合的神经网络,并且如果从一开始就使用煨炖法,则可以避免过拟合。我们的结果质疑了优化作为神经网络训练范式的地位,并利用信息几何论证指出,存在一类不以优化为起点的“足够好”训练算法。

关键词

引用

@article{arxiv.2410.19912,
  title  = {Simmering: Sufficient is better than optimal for training neural networks},
  author = {Irina Babayan and Hazhir Aliahmadi and Greg van Anders},
  journal= {arXiv preprint arXiv:2410.19912},
  year   = {2026}
}

备注

Minor corrections, clarifications