SigGate-GT:通过 Sigmoid 门控注意力驳除图变换器中的过平滑问题
机器学习
2026-04-21 v1 人工智能
摘要
图变换器在分子任务与长程推理任务上取得优异成绩,但仍受过平滑(节点表示随深度逐渐崩塌)及注意力熵退化的困扰。我们观察到,这类病态现象与大型语言模型中的注意力陷阱共享根本原因:softmax 注意力的逼和约束迫使每个节点必须 attend 到某处,即便无效信号也不例外。灵感来源于最近发现的元素级 sigmoid 门控可消除大型语言模型中的注意力陷阱,我们提出 SigGate-GT,一种在 GraphGPS 框架下对注意力输出施加可学习的逐头 sigmoid 门控的图变换器。每个门控可将激活压制至零,使注意力头能够选择性地静默无效连接。在五个标准基准测试中,SigGate-GT 在 ZINC(0.059 MAE)上与先前最佳结果持平,并在 ogbg-molhiv(82.47\% ROC-AUC)上刷新最新纪录, 的统计显著性优于 GraphGPS。消融实验表明,门控机制将过平滑降低 30\%(在 4-16 层间的平均相对 MAD 提升),提升注意力熵,扩大学习率范围的稳定性,可在 学习率下保持稳定训练,仅增加约 1\% 参数开销。
引用
@article{arxiv.2604.17324,
title = {SigGate-GT: Taming Over-Smoothing in Graph Transformers via Sigmoid-Gated Attention},
author = {Dongxin Guo and Jikun Wu and Siu Ming Yiu},
journal= {arXiv preprint arXiv:2604.17324},
year = {2026}
}
备注
16 pages, 2 figures, 15 tables