图神经网络中的海量激活:解码注意力以实现领域相关的可解释性
机器学习
2025-03-10 v3 人工智能
摘要
图神经网络(GNNs)因能有效建模图结构数据而日益普及,注意力机制在使这些模型捕获复杂模式方面发挥了关键作用。在我们的研究中,我们揭示了将注意力机制集成到含边特征 GNNs 中一个关键但尚未探索的后果:注意力层中海量激活的出现。通过开发一种检测边特征上海量激活的新方法,我们表明这些极端激活不仅是激活异常,而且编码了领域相关的信号。我们的事后可解释性分析表明,在分子图中,海量激活主要聚集在常见键类型(如单键和双键)上,而避开更具信息量的键(如三键)。此外,我们的消融研究证实,海量激活可以作为天然的归因指标,重新分配到信息量较低的边上。我们使用包括 ZINC、TOX21 和 PROTEINS 在内的基准数据集评估了各种基于边特征注意力的 GNN 模型。主要贡献包括:(1)确立了含边特征 GNNs 中注意力机制与海量激活生成之间的直接联系;(2)开发了海量激活的稳健定义和检测方法,实现了可靠的事后可解释性。总体而言,我们的研究揭示了注意力机制、含边特征 GNNs 模型与海量激活涌现之间的复杂相互作用,为将 GNNs 内部机制与领域知识联系起来提供了关键见解。
引用
@article{arxiv.2409.03463,
title = {Massive Activations in Graph Neural Networks: Decoding Attention for Domain-Dependent Interpretability},
author = {Lorenzo Bini and Marco Sorbi and Stephane Marchand-Maillet},
journal= {arXiv preprint arXiv:2409.03463},
year = {2025}
}