中文

归一化残差网络规模行为的定性测试-风险机制

机器学习 2026-05-12 v1 人工智能

摘要

规模行为——即模型规模和数据量增加时测试性能常常提升——是现代深度学习中的核心经验现象,然而其理论依据仍不完整。本文研究归一化残差网络中的深度扩展:从已训练的旧假设类模型开始,在中间层插入新的残差模块,我们探讨何时才能通过这种扩展实现可证明的测试风险改进。我们发展了统一框架,将该问题分解为表示性收益、优化收益和泛化迁移。首先,在零初始化附近满足一阶下降条件下,我们证明扩展后的假设类包含一个次要跳板模型,其总体风险严格小于原始模型。其次,在针对后归一化残差架构设计的范数控制下,我们为扩展模型类建立了范数基准的Rademacher复杂度上界。这些构件导致两种互补的测试风险保证:一种通过总体风险实现,若存在正总体边际时更紧密;另一种直接在训练/测试层面工作,避免Hoeffding迁移,在退化情形下更稳健。这些结果为归一化残差网络中残差深度扩展提升测试性能提供了理论驱动机制。更广泛地说,它们表明规模扩张本质上是联合的:深度创造新的改进方向,宽度增强弱信号的有限样本可观测性,而数据决定统计成本是否可控。

关键词

引用

@article{arxiv.2605.08297,
  title  = {A Qualitative Test-Risk Mechanism for Scaling Behavior in Normalized Residual Networks},
  author = {Daning Cheng and Zeyu Liu and Jun Sun and Fen Xia and Boyang Zhang and Dongping Liu and Yunquan Zhang},
  journal= {arXiv preprint arXiv:2605.08297},
  year   = {2026}
}