特征动力学作为隐式数据增强:深度神经网络泛化的深度分解视角
机器学习
2025-10-06 v2
摘要
深度网络为何泛化良好?与经典泛化理论不同,我们通过不仅考察输入和输出,还考察内部特征的演化来回答这一基本问题。我们的研究揭示了一种时间一致性现象:当早期检查点的浅层特征与后期检查点的深层特征结合时,预测保持稳定。这种稳定性并非平凡的收敛伪影。它充当一种隐式、结构化的增强形式,支撑泛化。我们证明时间一致性扩展到未见数据和受损数据,但在语义结构被破坏时(如随机标签)崩溃。统计检验进一步揭示 SGD 沿少数主方向注入各向异性噪声,强化其作为结构化变异源的作用。综合来看,这些发现提出了一种将特征动力学与泛化联系起来的概念视角,指向未来关于测量时间特征演化的实用替代指标的工作。
引用
@article{arxiv.2509.20334,
title = {Feature Dynamics as Implicit Data Augmentation: A Depth-Decomposed View on Deep Neural Network Generalization},
author = {Tianyu Ruan and Kuo Gai and Shihua Zhang},
journal= {arXiv preprint arXiv:2509.20334},
year = {2025}
}