GSTBench:图自监督学习可迁移性的基准研究
机器学习
2025-09-10 v1 人工智能
摘要
自监督学习(SSL)在图表征学习中展现出巨大潜力。然而,现有的多数图 SSL 方法是在单数据集设置下开发和评估的,其跨数据集的可迁移性在很大程度上未被探索,这限制了它们利用知识迁移和大规模预训练的能力,而这些因素对于开发超越拟合训练数据的泛化智能至关重要。为了填补这一空白并推进图基础模型研究,我们提出了 GSTBench,这是首个用于评估图 SSL 方法可迁移性的系统性基准。我们在 ogbn-papers100M 上进行大规模预训练,并在多种目标图上评估了五种具有代表性的 SSL 方法。我们标准化的实验设置解耦了模型架构、数据集特性和自适应协议等混淆因素,从而能够仅针对预训练目标进行严格比较。令人惊讶的是,我们观察到大多数图 SSL 方法难以泛化,有些甚至表现不如随机初始化。相比之下,作为一种掩码自编码器方法的 GraphMAE 持续提升了迁移性能。我们分析了驱动这些差异的潜在因素,并提供了指导未来可迁移图 SSL 研究的见解,为图学习中“预训练后迁移”范式奠定了坚实基础。我们的代码可在 https://github.com/SongYYYY/GSTBench 获取。
引用
@article{arxiv.2509.06975,
title = {GSTBench: A Benchmark Study on the Transferability of Graph Self-Supervised Learning},
author = {Yu Song and Zhigang Hua and Yan Xie and Jingzhe Liu and Bo Long and Hui Liu},
journal= {arXiv preprint arXiv:2509.06975},
year = {2025}
}
备注
Accepted at CIKM'25