变换器的广义线性模式连通性
机器学习
2025-11-14 v2 机器学习
摘要
理解神经网络损失函数景观的几何结构是深度学习中的核心问题,对于泛化性和优化具有深远影响。其中一种显著现象是线性模式连通性(Linear Mode Connectivity,LMC),即独立训练的模型可以通过低或零损失路径相互连接,尽管它们看似位于不同的损失盆地中。然而,这种现象常被参数空间中的对称性所遮蔽——例如神经元置换——这些对称性使得功能等效的模型看起来彼此不同。先前的工作主要集中在通过置换进行神经元重排,但此类方法在范围上受到限制,无法捕捉变换器等现代架构所展现的更丰富的对称性。本文引入一种统一框架,涵盖四种对称性类别:置换、半置换、正交变换和一般可逆映射,从而拓宽了有效重参数化的集合,并将许多先前方法作为特殊情况纳入其中。关键的是,这种泛化方法首次使我们能够在独立训练的视觉变换器(Vision Transformer)和 GPT-2 模型之间发现低或零阻力的线性插值路径。此外,我们的框架超越了两两对齐,扩展到多模型和宽度异构的设置,实现跨不同尺寸架构的对齐。这些结果揭示了损失景观中的更深层结构,凸显了对称性感知分析在理解模型空间几何方面的重要性。
引用
@article{arxiv.2506.22712,
title = {Generalized Linear Mode Connectivity for Transformers},
author = {Alexander Theus and Alessandro Cabodi and Sotiris Anagnostidis and Antonio Orvieto and Sidak Pal Singh and Valentina Boeva},
journal= {arXiv preprint arXiv:2506.22712},
year = {2025}
}
备注
Accepted to NeurIPS 2025 (Oral)