中文

面向图神经网络的自注意力层 Lipschitz 归一化

机器学习 2021-09-14 v3 机器学习

摘要

基于注意力的神经网络在大量应用中处于最先进水平。然而,当层数增加时,其性能往往下降。在这项工作中,我们表明通过归一化注意力分数来强制 Lipschitz 连续性可以显著改善深度注意力模型的性能。首先,我们表明对于深度图注意力网络(GAT),训练期间出现梯度爆炸,导致基于梯度的训练算法性能不佳。为解决此问题,我们推导了注意力模块的 Lipschitz 连续性理论分析,并引入 LipschitzNorm,一种简单且无参数的自注意力机制归一化方法,可强制模型满足 Lipschitz 连续性。随后我们将 LipschitzNorm 应用于 GAT 和 Graph Transformers,并表明在深度设置(10 至 30 层)下它们的性能得到实质性提升。更具体地,我们表明带有 LipschitzNorm 的深度 GAT 模型在展现长程依赖的节点标签预测任务中取得了最先进结果,同时在基准节点分类任务中相较其未归一化对应模型表现出一致改进。

关键词

引用

@article{arxiv.2103.04886,
  title  = {Lipschitz Normalization for Self-Attention Layers with Application to Graph Neural Networks},
  author = {George Dasoulas and Kevin Scaman and Aladin Virmaux},
  journal= {arXiv preprint arXiv:2103.04886},
  year   = {2021}
}

备注

18 pages. Proceedings of the 38th International Conference on Machine Learning, PMLR 139, 2021. Copyright 2021 by the author(s)