中文

GraphSculptor: 为图自监督学习雕刻预训练核心集

机器学习 2026-05-05 v1 人工智能

摘要

图自监督学习通常依赖大规模无标签数据集,这会显著增加计算成本。然而,实证证据表明,这些数据集包含 substantial redundancy——我们的分析显示,均匀抽样 50% 的图数据仍可保留超过 96% 的下游性能。为利用这种冗余性,我们引入 GraphSculptor 用于预训练核心集构建。不同于依赖额外训练时信号或仅限于拓扑统计的方法,GraphSculptor 提供一种无标签解决方案,通过内在结构和情境语义两个互补视角构建核心集。具体而言,结构多样性使用内在图统计量量化,为每个图生成结构特征向量;语义多样性则通过利用预训练语言模型对通过图到文本生成的描述进行编码来捕获。GraphSculptor 将这些信号整合到统一的度量空间中,并执行聚类感知选择以保留联合的结构-语义多样性。我们进一步推导了核心集与全数据预训练之间损失差距的理论上界,为选择方案提供了理论动机。大量实验表明,GraphSculptor 有效雕刻了数据集:仅 10% 的核心集即可实现 99.6% 的全数据性能,同时将预训练时间缩短近 90%,为数据高效的图预训练提供了可扩展解决方案。

关键词

引用

@article{arxiv.2605.01310,
  title  = {GraphSculptor: Sculpting Pre-training Coreset for Graph Self-supervised Learning},
  author = {Chuang Liu and Zelin Yao and Xueqi Ma and Luzhi Wang and Mukun Chen and Pinghua Xu and Wenbin Hu},
  journal= {arXiv preprint arXiv:2605.01310},
  year   = {2026}
}

备注

9 pages, 5 figures, Accepted by IJCAI 2026