共轭学习理论:揭示深度神经网络可训练性与泛化性的机制
机器学习
2026-02-20 v2 人工智能
机器学习
摘要
本文提出一种基于有限样本设置的实用可学习性概念,并基于凸共轭对偶性发展一种共轭学习理论框架,用于表征这种可学习性。基于这一基础,我们演示,使用小批量随机梯度下降 (SGD) 训练深度神经网络 (DNN) 可实现经验风险的全局最优解,通过同时控制结构矩阵的极端特征值和梯度能量,我们建立了相应的收敛定理。我们进一步阐明了批量大小和模型架构(包括深度、参数数量、稀疏性、跳跃连接以及其他特征)对非凸优化的影响。此外,我们推导了一个模型无关的下界,用于可实现的经验风险,从而在理论上表明数据决定了可训练性的根本限制。在泛化方面,我们基于广义条件熵测度推导出确定性和概率性的泛化误差界。前者显式地描绘了泛化误差的范围,而后者则在独立同分布 (i.i.d.) 采样条件下表征泛化误差相对于确定性界的分布。此外,这些界明确量化了三个关键因素的影响:(i) 模型中不可逆性导致的信息损失,(ii) 可达到的最大损失值,以及 (iii) 相对于标签的特征的广义条件熵。这些界为理解正则化、不可逆变换和网络深度在塑造深度神经网络泛化行为方面发挥的作用提供了统一的理论视角。大量实验验证了所有理论预测,确认了该框架的正确性和一致性。
引用
@article{arxiv.2602.16177,
title = {Conjugate Learning Theory: Uncovering the Mechanisms of Trainability and Generalization in Deep Neural Networks},
author = {Binchuan Qi},
journal= {arXiv preprint arXiv:2602.16177},
year = {2026}
}