LoGAH:用于预测77400万参数转换器的图神经网络(Low-rank Graph Hypernetworks)
机器学习
2024-05-28 v1
摘要
良好的深度学习模型初始化对于帮助模型更快更好地收敛至关重要。然而,大规模预训练模型对许多研究者而言不可负担,这使得对初始参数的精确预测变得更加必要。图神经网络(Graph HyperNetworks,GHNs)作为一种预测模型参数的方法,最近在初始化大型视觉模型方面表现出色。然而,预测非常宽的网络参数的做法依赖于多次复制小块参数,并且需要大量参数才能支持完整预测,这严重阻碍了其实际应用。为此,我们提出了LoGAH(Low-rank GrAph Hypernetworks),即一种带有低秩参数解码器的GHN,可显著扩展至更宽的网络,而无需像以前的尝试那样产生惊人的参数增长。LoGAH使我们能够在内存高效的条件下预测77400万大型神经网络的参数。我们展示,采用LoGAH初始化的视觉和语言模型(即ViT和GPT-2)的性能优于随机初始化或使用现有超网络的模型。此外,我们展示了在小数据集上训练LoGAH并使用预测参数为更大任务初始化的有前景的迁移学习结果。我们提供代码于https://github.com/Blackzxy/LoGAH。
引用
@article{arxiv.2405.16287,
title = {LoGAH: Predicting 774-Million-Parameter Transformers using Graph HyperNetworks with 1/100 Parameters},
author = {Xinyu Zhou and Boris Knyazev and Alexia Jolicoeur-Martineau and Jie Fu},
journal= {arXiv preprint arXiv:2405.16287},
year = {2024}
}
备注
16 pages