非线性优势:训练后的网络可能并不像你想象的那么复杂
机器学习
2023-06-02 v2 计算机视觉与模式识别
摘要
我们通过在网络中非线性单元总数上施加稀疏先验,对其部分特征通道进行完全线性化,从而对深度网络的行为进行实证研究。在图像分类和机器翻译任务的实验中,我们研究了在性能崩溃之前,可以将网络函数向线性简化到何种程度。首先,我们观察到在网络函数训练早期而非晚期减少非线性时存在显著的性能差距,这与近期关于数据依赖NTK时间演化的观察一致。其次,我们发现训练后能够在保持高性能的同时线性化大量非线性单元,表明网络的大部分表达能力未被使用,但有助于训练早期的梯度下降。为刻画所得部分线性化网络的深度,我们引入一种称为平均路径长度的度量,表示在网络图中沿一条路径遇到的平均活跃非线性数量。在稀疏压力下,我们发现剩余的非线性单元组织成 distinct 结构,形成有效深度和宽度近乎恒定的核心网络,而这又取决于任务难度。
引用
@article{arxiv.2211.17180,
title = {Nonlinear Advantage: Trained Networks Might Not Be As Complex as You Think},
author = {Christian H. X. Ali Mehmeti-Göpel and Jan Disselhoff},
journal= {arXiv preprint arXiv:2211.17180},
year = {2023}
}