中文

通过蒸馏增强 Transformer 的 GNN 结构知识:一种新方法

机器学习 2025-03-05 v1 人工智能

摘要

将图神经网络(GNN)的结构归纳偏置与 Transformer 的全局上下文建模能力相结合,是图表示学习中的一个关键挑战。虽然 GNN 通过消息传递机制擅长捕获局部拓扑模式,但其在建模长程依赖和并行化方面的固有局限性阻碍了其在大规模场景中的部署。相反,Transformer 利用自注意力机制实现全局感受野,但难以继承 GNN 的内在图结构先验。本文提出了一种新颖的知识蒸馏框架,系统地将 GNN 教师模型中的多尺度结构知识转移到 Transformer 学生模型中,为解决跨架构蒸馏中的关键挑战提供了新视角。该框架通过微观-宏观蒸馏损失和多尺度特征对齐,有效弥合了 GNN 与 Transformer 之间的架构差距。本工作为在 Transformer 架构中继承图结构偏置建立了新范式,具有广阔的应用前景。

关键词

引用

@article{arxiv.2503.01888,
  title  = {Enhancing Transformer with GNN Structural Knowledge via Distillation: A Novel Approach},
  author = {Zhihua Duan and Jialin Wang},
  journal= {arXiv preprint arXiv:2503.01888},
  year   = {2025}
}