中文

跨域图数据缩放:基于扩散模型的展示

机器学习 2025-10-08 v3

摘要

自然语言和图像模型受益于数据缩放行为:输入模型的数据越多,其性能越好。这种“多多益善”的现象使得在海量数据上进行大规模预训练行之有效。然而,由于图之间的异构性,当前的图预训练方法难以扩大数据规模。为了实现有效的数据缩放,我们旨在开发一个通用模型,该模型能够捕获图的多样化数据模式,并可用于自适应地辅助下游任务。为此,我们提出了 UniAug,一个基于扩散模型构建的通用图结构增强器。我们首先在跨域的数千个图上预训练一个离散扩散模型,以学习图结构模式。在下游阶段,我们通过引导生成,借助预训练的扩散模型进行图结构增强,从而提供自适应提升。通过利用预训练的扩散模型进行结构增强,我们以即插即用的方式在各种下游任务中持续取得性能提升。据我们所知,本研究首次展示了在跨域图上的数据缩放图结构增强器。

关键词

引用

@article{arxiv.2406.01899,
  title  = {Cross-Domain Graph Data Scaling: A Showcase with Diffusion Models},
  author = {Wenzhuo Tang and Haitao Mao and Danial Dervovic and Ivan Brugere and Saumitra Mishra and Yuying Xie and Jiliang Tang},
  journal= {arXiv preprint arXiv:2406.01899},
  year   = {2025}
}

备注

NeurIPS'25