通过设计实现低秩学习:网络架构与激活线性度在梯度秩坍缩中的作用
机器学习
2024-02-13 v1
摘要
我们对深度神经网络(DNN)学习动态的理解仍不完整。最近的研究开始揭示这些网络背后的数学原理,包括“神经坍缩”现象,其中DNN内的线性分类器在训练后期收敛到特定的几何结构。然而,学习中的几何约束作用并不局限于这个终末阶段。例如,全连接层中的梯度由于训练批次上秩一外积的累积而自然形成低秩结构。尽管利用这种结构进行内存节省或正则化的方法受到了关注,但低秩学习作为某些DNN架构固有方面的出现尚未得到充分探索。在本文中,我们对DNN中的梯度秩进行了全面研究,考察了架构选择和数据结构如何影响梯度秩的界限。我们的理论分析为训练全连接、循环和卷积神经网络提供了这些界限。我们还从理论和实验上展示了设计选择如激活函数线性度、瓶颈层引入、卷积步长和序列截断如何影响这些界限。我们的发现不仅有助于理解DNN的学习动态,还为深度学习工程师做出明智的设计决策提供了实用指导。
引用
@article{arxiv.2402.06751,
title = {Low-Rank Learning by Design: the Role of Network Architecture and Activation Linearity in Gradient Rank Collapse},
author = {Bradley T. Baker and Barak A. Pearlmutter and Robyn Miller and Vince D. Calhoun and Sergey M. Plis},
journal= {arXiv preprint arXiv:2402.06751},
year = {2024}
}