学习规则对宽神经网络中表征动力学的影响
机器学习
2023-05-29 v2 无序系统与神经网络
统计力学
机器学习
摘要
目前尚不清楚改变深度神经网络的学习规则会如何改变其学习动力学与表征。为深入理解所学特征、函数逼近与学习规则之间的关系,我们分析了以梯度下降(GD)及生物学上合理的替代方案训练的无限宽深度网络,这些方案包括反馈对齐(FA)、直接反馈对齐(DFA)、误差调制赫布学习(Hebb)以及门控线性网络(GLN)。我们表明,对于这些学习规则中的每一种,无限宽下输出函数的演化都由时变有效神经正切核(eNTK)所支配。在惰性训练极限下,该 eNTK 是静态且不演化的,而在丰富的平均场机制中,该核的演化可通过动力学平均场理论(DMFT)自洽确定。该 DMFT 使得比较由这些学习规则各自诱导的特征与预测动力学成为可能。在惰性极限下,我们发现 DFA 和 Hebb 只能利用最后一层特征进行学习,而完整 FA 可利用更早的层,其尺度由前馈与反馈权重矩阵间的初始相关性决定。在丰富机制中,DFA 和 FA 利用随时间演化且依赖于深度的 NTK。出人意料地,我们发现于丰富机制中训练的 FA 网络,若前向与反向传播权重间初始相关性较小,则表现出更多的特征学习。GLN 对其惰性极限核承认一个非常简单的公式,并在门控函数下保持预激活的条件高斯性。误差调制赫布规则显示出其核与任务相关的对齐极小,并在最后一层完成大部分任务相关的学习。
引用
@article{arxiv.2210.02157,
title = {The Influence of Learning Rule on Representation Dynamics in Wide Neural Networks},
author = {Blake Bordelon and Cengiz Pehlevan},
journal= {arXiv preprint arXiv:2210.02157},
year = {2023}
}
备注
ICLR 2023 Camera Ready