优化器如何塑造等变神经网络中的学习解
机器学习
2026-05-28 v1 人工智能
摘要
等变神经网络通过构造编码了几何对称性,但它们通常难以优化,并且可能表现不如约束较少的架构。越来越多的研究通过架构修改(例如约束松弛或近似等变)来解决这个问题,而优化器的作用相对而言仍未得到充分探索。我们通过比较Muon和Adam在点云和分子学习设置下的几种等变和几何架构来研究这一方向。在对比最清晰的ModelNet40上,Muon在所有考虑的架构上都持续优于Adam。然后,我们通过Hessian估计、损失曲面可视化以及学习权重和中间表示的谱特性来分析训练好的ModelNet40检查点。Muon达到的检查点具有更大的Hessian曲率汇总值,但损失曲面更规则,并且它们学习到的权重和表示具有更高的稳定秩和有效秩。这些观察表明,优化器设计与几何归纳偏置之间的相互作用值得学术界进一步关注。
引用
@article{arxiv.2605.27662,
title = {How the Optimizer Shapes Learned Solutions in Equivariant Neural Networks},
author = {Teodor-Mihai Stupariu and Andrei Manolache},
journal= {arXiv preprint arXiv:2605.27662},
year = {2026}
}
备注
Accepted at ICML 2026 Workshop on Weight-Space Symmetries