中文

通过线性视角解析 ReLU 网络的训练动力学

机器学习 2025-11-11 v1 人工智能

摘要

深度神经网络,特别是使用线性整流单元 (ReLU) 的网络,常被视为复杂的、高维的、非线性系统。这一复杂性构成了理解其内部学习机制的重大挑战。本文提出了一种新型分析框架,将多层 ReLU 网络重新诠释为具有输入依赖"有效权重"的单层线性模型。对于给定的输入样本,ReLU单元的激活模式创建独特的计算路径,实际上消零网络中一部分权重的作用。通过在所有层中组合活跃权重,我们可以推导出一个将输入直接映射到该特定样本输出的有效权重矩阵 Weff(x)W_{\text{eff}}(x)。我们认为,追踪这些有效权重的演化揭示了表征学习的基本原理。我们的工作表明,随着训练的进行,来自同一类别样本的有效权重会趋于收敛,而来自不同类别样本的有效权重则会趋于发散。通过追踪这些样本级有效权重的轨迹,我们为解释类别特定决策边界的形成以及网络中语义表征的出现提供了新的视角。

关键词

引用

@article{arxiv.2511.05628,
  title  = {Unveiling the Training Dynamics of ReLU Networks through a Linear Lens},
  author = {Longqing Ye},
  journal= {arXiv preprint arXiv:2511.05628},
  year   = {2025}
}