早期退出网络何时能泛化?自适应深度的PAC-Bayesian理论
机器学习
2026-04-20 v1 人工智能
摘要
早期退出神经网络通过允许置信预测在中间层退出,从而实现2-8倍的推理加速。尽管其已广泛部署,但其泛化特性缺乏理论理解——这一差距已被近期调查明确指出。本文建立了统一的PAC-Bayesian框架用于自适应深度网络。(1) novel Entropy-Based Bounds:我们证明了首个基于退出深度熵H(D)和期望深度E[D]而非最大深度K的泛化界,样本复杂度为O((E[D]·d + H(D))/ε²)。(2) Explicit Constructive Constants:我们的分析给出主导系数√(2ln2)≈1.177,并提供完整推导。(3) Provable Early-Exit Advantages:我们建立了自适应深度网络严格优于固定深度网络的充分条件。(4) Extension to Approximate Label Independence:我们放宽标签独立假设至ε近似策略,拓宽了学习型路由的适用性。(5) Comprehensive Validation:跨6种架构在7个基准上的实验显示,紧密度比经典界限高出1.52-3.87倍(所有p<0.001),而经典界限则超过100倍。基于界导数的阈值选择在验证调优性能上仅有0.1-0.3%的差距。
关键词
引用
@article{arxiv.2604.15764,
title = {When Do Early-Exit Networks Generalize? A PAC-Bayesian Theory of Adaptive Depth},
author = {Dongxin Guo and Jikun Wu and Siu Ming Yiu},
journal= {arXiv preprint arXiv:2604.15764},
year = {2026}
}
备注
6 pages, 1 figure, 7 tables, 1 algorithm