中文

揭示神经网络学习子空间的所用秩

计算机视觉与模式识别 2024-07-09 v1 机器学习

摘要

本文研究神经网络所学习权重的空间利用情况。这一概念与网络容量相关,但还包含网络架构与数据集之间的相互作用。大多数学习到的权重似乎是满秩的,因而不适合低秩分解。这看似暗示权重正在充分利用其可用空间。我们提出了一种简单的数据驱动转换,将权重投影到数据与权重相互作用的子空间中。这保留了图层的功能映射,从而揭示其低秩结构。在我们的发现中,我们得出结论大多数模型实际上只利用了可用空间的一部分。例如,针对在 ImageNet 上训练的 ViTB-16 和 ViTL-16,平均层利用率分别为 35% 和 20%。我们的转换结果使参数量分别降至 50% 和 25%,而在微调后准确率下降不到 0.2%。我们还展示,自监督预训练可将该利用率提升至 70%,这证明了其对下游任务的适合性。

关键词

引用

@article{arxiv.2407.04797,
  title  = {Revealing the Utilized Rank of Subspaces of Learning in Neural Networks},
  author = {Isha Garg and Christian Koguchi and Eshan Verma and Daniel Ulbricht},
  journal= {arXiv preprint arXiv:2407.04797},
  year   = {2024}
}

备注

Presented at Efficient Systems for Foundation Models Workshop at the International Conference on Machine Learning (ICML) 2024