中文

通过预训练实现图转换器在多样图与任务上的泛化

机器学习 2025-11-07 v4 社会与信息网络

摘要

图预训练主要集中在涉及小型图(如分子图)的图级任务或固定图上学习节点表示的任务上。将图预训练模型扩展到工业场景中具有数十亿节点的网络规模,同时避免跨图或跨任务的负迁移,仍是挑战。我们致力于开发一种具备归纳能力的通用图预训练模型,使其能够对未见的新节点甚至新图进行预测。本文引入一种基于转换器的可扩展图预训练框架,称为PGT(预训练图转换器)。基于掩码自编码器架构,我们设计了两种预训练任务:一种用于重构节点特征,另一种用于重构局部结构。不同于原始自编码器的预训练解码器被丢弃的做法,我们提出一种新颖策略,利用解码器进行特征增强。该框架在公开的ogbn-papers100M数据集上进行测试,包含1.11亿个节点和16亿条边,实现了最先进的性能,展示了其可扩展性和效率。我们将该框架部署在腾讯在线游戏数据上,确认其能够在拥有5.4亿个节点和120亿条边的真实世界图上预训练,并在多样静态和动态下游任务上有效泛化。

关键词

引用

@article{arxiv.2407.03953,
  title  = {Generalizing Graph Transformers Across Diverse Graphs and Tasks via Pre-training},
  author = {Yufei He and Zhenyu Hou and Yukuo Cen and Jun Hu and Feng He and Xu Cheng and Jie Tang and Bryan Hooi},
  journal= {arXiv preprint arXiv:2407.03953},
  year   = {2025}
}

备注

Accepted by IEEE Transactions on Knowledge and Data Engineering (TKDE)