中文

神经网络中的半空间特征学习

机器学习 2024-04-09 v1 人工智能 神经与进化计算

摘要

目前存在两种极端观点对神经网络特征学习持有观点:(i)神经网络仅实现核方法(类似于NTK),因此未学习特征;(ii)神经网络能够表示(并因此学习)适用于数据的复杂层次特征。我们在本文中提出, neither 解释都可能不正确。我们提出神经网络可视为专家混合体,其中每个专家对应于通过一系列隐藏单元的一条(层数长度)路径。我们采用这种替代解释来激发一种模型,称为深层线性门控网络(Deep Linearly Gated Network, DLGN),其位于深层线性网络和ReLU网络之间。与深层线性网络不同,DLGN能够学习非线性特征(随后被线性组合),而与ReLU网络不同,这些特征最终是简单的——每个特征实际上是一个指示函数,用于描述输入空间中由(层数)个半空间交集紧凑描述的区域。这种观点允许对特征进行全面全局可视化,而非基于显著性/激活/梯度图的局部神经元可视化。在DLGN中,特征学习的发生情况及其机制通过学习包含目标函数平滑区域的半空间来实现。由于DLGN的结构,后续层的神经元与早期层的神经元根本相同——它们都表示一个半空间——然而,梯度下降的动力学赋予后续层神经元显著的聚类。我们假设ReLU网络也具有类似的特征学习行为。

关键词

引用

@article{arxiv.2404.04312,
  title  = {Half-Space Feature Learning in Neural Networks},
  author = {Mahesh Lorik Yadav and Harish Guruprasad Ramaswamy and Chandrashekar Lakshminarayanan},
  journal= {arXiv preprint arXiv:2404.04312},
  year   = {2024}
}