多窄分支变换作为单模型集成:边界条件、机制与失效模式
机器学习
2026-05-13 v1
摘要
单模型集成(SMEs)因能在单一网络内近似深度集成的部分优势而受到关注。然而,在参数预算大致匹配的情况下,模型容量应集中于单一宽通路还是重新分配到多个窄且独立的成员中,这一问题仍不明确。我们通过多窄分支(MN)变换来研究此问题,该变换将基线卷积神经网络(CNN)转换为一个由窄且路径独立的多个分支构成的单模型集成,同时大致保持主导参数预算不变。我们在不同的训练数据规模、架构和数据集上系统比较了单宽与多窄配置。结果表明,MN 的有效性强烈依赖于数据:在数据丰富的场景下,弱划分或基线宽模型更优;而在低数据场景下,高划分度的 MN 模型始终优于基线。这一趋势在多种 CNN 架构和图像分类数据集上均得到复现,表明其并非特定于某个基准或模型族。对内部表征的分析显示,高 MN 模型学习到更多样化且冗余度更低的路径特征。在低数据场景下,这种多样性被广泛利用并提升了泛化能力;而在数据丰富的场景下,训练变得不均衡,预测由少数路径主导。这些发现阐明了多窄分支变换何时以及为何有效,并为在有限预算下如何在宽度与成员数量之间分配模型容量提供了实践指导。
引用
@article{arxiv.2605.11530,
title = {Multi-Narrow Transformation as a Single-Model Ensemble: Boundary Conditions, Mechanisms, and Failure Modes},
author = {Tatsuhito Hasegawa and Taisei Tanaka},
journal= {arXiv preprint arXiv:2605.11530},
year = {2026}
}
备注
12 pages, 9 figures, 4 tables. Preprint version of a manuscript submitted to Neurocomputing