中文

优化器如何塑造等变神经网络中的学习解

机器学习 2026-05-28 v1 人工智能

摘要

等变神经网络通过构造编码了几何对称性,但它们通常难以优化,并且可能表现不如约束较少的架构。越来越多的研究通过架构修改(例如约束松弛或近似等变)来解决这个问题,而优化器的作用相对而言仍未得到充分探索。我们通过比较Muon和Adam在点云和分子学习设置下的几种等变和几何架构来研究这一方向。在对比最清晰的ModelNet40上,Muon在所有考虑的架构上都持续优于Adam。然后,我们通过Hessian估计、损失曲面可视化以及学习权重和中间表示的谱特性来分析训练好的ModelNet40检查点。Muon达到的检查点具有更大的Hessian曲率汇总值,但损失曲面更规则,并且它们学习到的权重和表示具有更高的稳定秩和有效秩。这些观察表明,优化器设计与几何归纳偏置之间的相互作用值得学术界进一步关注。

关键词

引用

@article{arxiv.2605.27662,
  title  = {How the Optimizer Shapes Learned Solutions in Equivariant Neural Networks},
  author = {Teodor-Mihai Stupariu and Andrei Manolache},
  journal= {arXiv preprint arXiv:2605.27662},
  year   = {2026}
}

备注

Accepted at ICML 2026 Workshop on Weight-Space Symmetries