神经网络的 Hessian 特征向量与权重矩阵的主成分分析
机器学习
2023-11-02 v1
摘要
本研究深入探究训练后的深度神经网络及其与网络参数之间的复杂动态关系。训练后的网络主要沿单一方向继续训练,称为漂移模式(drift mode)。该漂移模式可由损失函数的二次势模型解释,表明其向势极小值缓慢指数衰减。我们揭示了 Hessian 特征向量与网络权重之间的相关性。这种关系取决于特征值的大小,使我们能够辨别网络内的参数方向。值得注意的是,这些方向的重要性依赖于两个决定性属性:其势阱的曲率(由 Hessian 特征值的大小指示)以及与权重向量的对齐程度。我们的探索延伸至通过奇异值分解对权重矩阵进行分解。该方法在识别 Hessian 中的关键方向时兼顾其大小与曲率,被证明具有实用性。此外,我们的研究展示了主成分分析在近似 Hessian 方面的适用性,且在此过程中更新参数作为选择优于权重。值得注意的是,我们的发现揭示了各层与整个网络的最大 Hessian 特征值之间的相似性。具体而言,较高特征值更多地集中在更深层中。利用这些见解,我们着手解决灾难性遗忘问题——即神经网络在学习新任务同时保留旧任务知识时所面临的挑战。通过应用我们的发现,我们制定了一种缓解灾难性遗忘的有效策略,提供了一种可应用于不同规模网络(包括更大架构)的可能解决方案。
引用
@article{arxiv.2311.00452,
title = {Hessian Eigenvectors and Principal Component Analysis of Neural Network Weight Matrices},
author = {David Haink},
journal= {arXiv preprint arXiv:2311.00452},
year = {2023}
}
备注
Master thesis: 60 pages, 35 figures