学习理论(有时)可以解释图神经网络的泛化性
机器学习
2021-12-09 v1 机器学习
摘要
近年来,监督学习环境中的一些结果表明,经典的统计学习理论度量,如 VC 维,不能充分解释深度学习模型的性能,这促使了在无限宽度和迭代机制下的大量工作。然而,对于神经网络在监督学习环境之外的成功,几乎没有理论解释。在本文中,我们认为,在某些分布假设下,经典的学习理论度量可以充分解释图神经网络在直推式环境中的泛化性。特别是,我们通过分析图卷积网络在节点分类问题上的泛化性质,对神经网络在直推式推理背景下的性能进行了严格分析。虽然 VC 维在这种环境下也确实会导致平凡的泛化误差界,但我们表明直推式 Rademacher 复杂度可以解释图卷积网络在随机块模型上的泛化性质。我们进一步使用基于直推式 Rademacher 复杂度的泛化误差界来证明图卷积和网络架构在实现更小泛化误差中的作用,并提供了关于图结构何时有助于学习的见解。本文的发现可能会重新激发人们在特定问题中从学习理论度量角度研究神经网络泛化性的兴趣。
引用
@article{arxiv.2112.03968,
title = {Learning Theory Can (Sometimes) Explain Generalisation in Graph Neural Networks},
author = {Pascal Mattia Esser and Leena Chennuru Vankadara and Debarghya Ghoshdastidar},
journal= {arXiv preprint arXiv:2112.03968},
year = {2021}
}
备注
35th Conference on Neural Information Processing Systems (NeurIPS 2021)