反向过度平滑:为何深度图神经网络难以训练?
机器学习
2026-03-16 v2
摘要
过度平滑长期以来被视为图神经网络(GNN)的主要局限:输入节点特征在每一层被平滑,当 GNN 的权重足够有界时收敛到无信息表示。这一假设至关重要:反之,若权重足够大,则过度平滑可能不会发生。理论上,GNN 因此可以学会不过度平滑。然而在实践中这并未真正发生,这促使我们从优化角度审视过度平滑。本文分析反向过度平滑,即用于计算梯度的反向传播误差同样受到从输出到输入的过度平滑影响。在非线性激活函数下,我们阐述了前向平滑与反向平滑之间相互作用的关键角色。此外,我们证明由于反向过度平滑,GNN 明显存在许多虚假驻点:一旦最后一层被训练,整个 GNN 便处于驻点。因此,我们可以展示梯度接近零而损失仍然较高的区域。该证明依赖于这样一个事实:与前向过度平滑不同,反向误差即使在非线性激活函数存在的情况下也受到线性过度平滑的影响,使得输出误差的平均值扮演关键角色。此外,我们证明该现象是深度 GNN 特有的,并给出了反例多层感知器。本文是更深入理解 GNN 特有优化景观的一步。
引用
@article{arxiv.2505.16736,
title = {Backward Oversmoothing: why is it hard to train deep Graph Neural Networks?},
author = {Nicolas Keriven},
journal= {arXiv preprint arXiv:2505.16736},
year = {2026}
}