中文

欲速则不达:特征学习 ReLU 网络中涌现的结构化混合选择性理论

机器学习 2025-04-01 v2

摘要

尽管有限维 ReLU 神经网络是近期深度学习成功背后的一贯因素,但这些模型中的特征学习理论仍然难以捉摸。目前,具有启发性的理论仍依赖于一些假设,包括网络计算的线性性、非结构化输入数据以及诸如无限宽度或单隐藏层的架构约束。为了开始填补这一空白,我们建立了 ReLU 网络与门控深度线性网络之间的等价性,并利用后者更强的可处理性来推导学习动力学。随后,我们考虑了一个核心任务的多种变体,这些任务类似于多任务学习或上下文控制,同时需要特征学习和非线性。我们明确指出,对于这些任务,ReLU 网络对潜在表示具有一种归纳偏置,这些表示并非严格模块化或解耦,但仍然高度结构化且可在不同上下文间复用。随着更多上下文和隐藏层的加入,这种效应被放大。因此,我们向有限 ReLU 网络中的特征学习理论迈出了一步,并阐明了由于对节点复用和学习速度的偏置,结构化混合选择性潜在表示是如何涌现的。

关键词

引用

@article{arxiv.2503.06181,
  title  = {Make Haste Slowly: A Theory of Emergent Structured Mixed Selectivity in Feature Learning ReLU Networks},
  author = {Devon Jarvis and Richard Klein and Benjamin Rosman and Andrew M. Saxe},
  journal= {arXiv preprint arXiv:2503.06181},
  year   = {2025}
}

备注

35 pages; 9 figures; accepted at the International Conference on Learning Representations (ICLR)