我们真的需要置换吗?模型宽度对线性模式连通性的影响
机器学习
2026-03-09 v3
摘要
最近,Ainsworth 等人通过实证表明,给定两个独立训练的模型,应用保持输入-输出行为的参数置换可以使两个模型通过低损失线性路径相连。当这样的路径存在时,称模型实现了线性模式连通性(LMC)。包括 Ainsworth 等人(2023)在内的先前研究报道,实现 LMC 不仅需要合适的置换搜索,还需要足够宽的模型(例如 ResNet-20 的 32× 宽度乘数)。这被广泛认为是因为增加模型宽度确保了足够大的候选置换空间,增加了找到能产生 LMC 的置换的可能性。在本工作中,我们通过实证表明,即使没有任何置换,仅通过加宽模型并使用合适的 softmax 温度校准就足以实现 LMC。我们进一步通过分析中间层输出解释了该现象。具体而言,我们引入了逐层指数加权连通性(LEWC),其指出合并模型的每层输出可以表示为原始模型对应层输出的指数加权和。因此合并模型的输出与原始模型的集成输出相匹配,从而促进 LMC。据我们所知,本工作是第一个表明加宽模型不仅如先前研究所建议的那样促进非线性模式连通性,而且显著提高实现线性模式连通性的可能性。
引用
@article{arxiv.2510.08023,
title = {Do We Really Need Permutations? Impact of Model Width on Linear Mode Connectivity},
author = {Akira Ito and Masanori Yamada and Daiki Chijiwa and Atsutoshi Kumagai},
journal= {arXiv preprint arXiv:2510.08023},
year = {2026}
}
备注
Accepted to the Fourteenth International Conference on Learning Representations (ICLR 2026). OpenReview: https://openreview.net/forum?id=ll8GLAic7q