老亦可贵:更好的梯度流能让原始GCN重焕光彩
机器学习
2022-10-18 v1 社会与信息网络
摘要
尽管图卷积网络(GCNs)在建模图结构数据方面取得巨大成功,当前大多数GCN因臭名昭著的过平滑与信息挤压问题,以及由梯度消失与过拟合引起的常规困难而较为浅层。先前工作主要关注深度GCN训练中的过平滑与过挤压现象研究。令人惊讶的是,与CNNs/RNNs相比,关于健康梯度流如何有益于深度GCN可训练性的理解甚少。本文中,我们首先提供梯度流的新视角来理解深度GCN的欠佳表现,并假设通过促进健康梯度流,可显著改善其可训练性,并从原始GCN达到最先进(SOTA)水平性能。接着,我们认为盲目采用Glorot初始化用于GCN并非最优,并基于等距原理推导出用于原始GCN的拓扑感知等距初始化方案。此外,与随意添加跳跃连接不同,我们提出使用带跳跃连接的梯度引导动态重连来改造原始GCN。我们的动态重连方法利用训练中各层内的梯度流来自适应引入按需跳跃连接。我们跨多个数据集提供了广泛实证证据,表明我们的方法改善了深度原始GCN中的梯度流,并显著提升其性能,足以媲美并超越许多花哨的最先进方法。代码见:https://github.com/VITA-Group/GradientGCN。
引用
@article{arxiv.2210.08122,
title = {Old can be Gold: Better Gradient Flow can Make Vanilla-GCNs Great Again},
author = {Ajay Jaiswal and Peihao Wang and Tianlong Chen and Justin F. Rousseau and Ying Ding and Zhangyang Wang},
journal= {arXiv preprint arXiv:2210.08122},
year = {2022}
}
备注
Advances in Neural Information Processing Systems (NeurIPS), 2022