动态图Transformer中的注意力分散:诊断与一种可迁移的修复方法
机器学习
2026-05-18 v1 人工智能
摘要
基于Transformer的架构已成为连续时间动态图(CTDG)学习的主导范式,但其在时间偏移数据集上的性能仍然有限。在这项工作中,我们识别出注意力分散是动态图Transformer在时间分布偏移下的一种共同失效模式。通过将结构和时间上可区分的邻居与随机邻居进行对比的受控消融实验,我们表明预测依赖于一类关键节点,这些节点始终比任意邻居携带更多的预测信号。然而,现有的Transformer即使这些节点存在于输入中,也无法聚焦于它们,因为时间偏移削弱了注意力对比度,并产生了过度分散的注意力分布。这一诊断提示了一种简单且可迁移的修复方法:用差分注意力替换标准注意力,该方法抑制共模注意力并放大独特的token级信号。当将差分注意力添加到三个具有代表性的CTDG Transformer基线中时,它持续提升了性能,且增益集中在高偏移数据集上。注意力层面的测量进一步证实了这一机制,显示注意力熵降低,且关键节点上的注意力质量增加。基于这些发现,我们引入了DiffDyG,这是一个将差分注意力与标准输入编码相结合的参考实现。在9个基准测试和三种负采样协议上,DiffDyG实现了SOTA性能,在偏移最大的数据集上增益尤为显著。
引用
@article{arxiv.2605.16112,
title = {Attention Dispersion in Dynamic Graph Transformers: Diagnosis and a Transferable Fix},
author = {Jinhao Zhang and Kangfei Zhao and Qiuhao Zeng and Long-Kai Huang},
journal= {arXiv preprint arXiv:2605.16112},
year = {2026}
}