中文

图对比学习与未训练基线:数据集规模的作用

机器学习 2025-09-04 v1 软凝聚态物质

摘要

图对比学习(GCL)已成为图上自监督学习的主导范式,在标准化数据集上表现出强劲性能,并在基因组学到药物发现等领域有日益广泛的应用。我们提出了一个基本问题:GCL是否真的优于未训练基线?我们发现GCL的优势高度依赖于数据集规模和任务难度。在标准数据集上,未训练的图神经网络(GNN)、简单的多层感知器甚至手工设计的统计量都可以与GCL相媲美或超越。在大型分子数据集ogbg-molhiv上,我们观察到一个交叉现象:GCL在小规模时落后,但在几千个图之后反超,尽管这种提升最终趋于平稳。在合成数据集上,GCL准确率大致随图数量的对数缩放,其与未训练GNN的性能差距随任务复杂度而变化。向前看,至关重要的是要识别数据集规模在基准测试和应用中的作用,以及设计能够避免性能平台期的GCL算法。

关键词

引用

@article{arxiv.2509.01541,
  title  = {Graph Contrastive Learning versus Untrained Baselines: The Role of Dataset Size},
  author = {Smayan Khanna and Doruk Efe Gökmen and Risi Kondor and Vincenzo Vitelli},
  journal= {arXiv preprint arXiv:2509.01541},
  year   = {2025}
}

备注

12 pages, 5 figures