中文

提升训练与反演方法的统一框架

机器学习 2026-02-09 v2 数值分析 数值分析 最优化与控制 机器学习

摘要

深度神经网络的训练主要依赖于基于梯度的优化与反向传播相结合来计算梯度。尽管该方法取得了巨大成功,但仍面临诸多挑战,例如梯度消失或爆炸、与非光滑激活函数难以兼容,以及其固有的顺序结构限制了并行化程度。提升(lifted)训练方法提供了一种替代方案:它将嵌套优化问题重新表述为一个高维约束优化问题,其中约束不再被直接强制执行,而是通过惩罚项加以惩罚。本章介绍了一个统一框架,该框架涵盖了多种提升训练策略,包括辅助坐标法(Method of Auxiliary Coordinates)、Fenchel 提升网络(Fenchel Lifted Networks)以及提升 Bregman 训练(Lifted Bregman Training),并展示了多层感知机、残差神经网络和近端神经网络等多种架构如何纳入这一框架之中。通过利用凸优化工具(尤其是 Bregman 距离),该框架便于分布式优化,可容纳不可微的近端激活函数,并能改善训练景观的条件数。我们讨论了使用块坐标下降策略来实现这些方法,包括结合加速与自适应优化技术的确定性实现,以及隐式随机梯度方法。此外,我们还探讨了该框架在反问题中的应用,详细阐述了用于训练专用网络(例如展开式架构)以及预训练网络稳定反演的方法。在标准成像任务上的数值结果验证了提升 Bregman 方法相较于传统训练的有效性与稳定性,尤其对于采用近端激活函数的架构而言。

关键词

引用

@article{arxiv.2510.09796,
  title  = {A Unified Framework for Lifted Training and Inversion Approaches},
  author = {Xiaoyu Wang and Alexandra Valavanis and Azhir Mahmood and Andreas Mang and Martin Benning and Audrey Repetti},
  journal= {arXiv preprint arXiv:2510.09796},
  year   = {2026}
}