中文

激活稀疏性对卷积神经网络过拟合的影响

机器学习 2021-04-14 v1

摘要

过拟合是训练卷积神经网络时的基本挑战之一,通常通过训练损失与测试损失的发散来识别。然而,激活流如何诱导过拟合的潜在动态机制尚不清楚。在本研究中,我们引入基于困惑度的稀疏性定义,以推导并可视化逐层激活度量。这些新颖的可解释AI策略揭示了激活稀疏性与过拟合之间令人惊讶的关系,即在测试损失开始上升前不久,特征提取层中的稀疏性增加。该趋势在网络架构与正则化策略间保持一致,因此我们的度量可作为过拟合的可靠指标,同时将网络的泛化能力与其基于损失的定义解耦。此外,我们的可微稀疏性公式可用于在训练中显式惩罚稀疏性的出现,从而可实时研究降低稀疏性对过拟合的影响。应用该惩罚并分析知名正则化器与常见网络架构中的激活稀疏性,支持了如下假设:降低激活稀疏性可有效改善泛化与分类性能。与其他近期相关工作的结论一致,我们的方法通过对稠密激活能够在充分利用深度模型容量进行判别性特征学习且不过拟合(即使过度训练)的演示,揭示了激活稀疏性与网络容量这一矛盾概念的新见解。

关键词

引用

@article{arxiv.2104.06153,
  title  = {The Impact of Activation Sparsity on Overfitting in Convolutional Neural Networks},
  author = {Karim Huesmann and Luis Garcia Rodriguez and Lars Linsen and Benjamin Risse},
  journal= {arXiv preprint arXiv:2104.06153},
  year   = {2021}
}