SAMGPT:面向多域预训练与跨域适应的文本无关图基础模型
计算与语言
2025-04-15 v2 人工智能
摘要
图可以建模在线服务中相互关联的实体,支持Web上广泛的应用。这引出一个重要问题:如何在多个源域上训练图基础模型,并适配未见目标域?主要障碍在于来自不同域的图往往呈现出差异异的特征。一些研究利用大型语言模型基于与图关联的文本描述对多个域进行对齐,这限制了其针对无文本属性图的适用性。对于文本无关的图,仅有少数近期工作尝试跨域对齐特征分布,同时通常忽视结构差异。在本工作中,我们提出一种 novel 的 Structure Alignment 框架,用于文本无关的 Multi-domain Graph Pre-Training 和跨域适应(SAMGPT)。其设计旨在从来自多个源域的图中学习多域知识,以便适用于未知目标域的应用。具体而言,我们引入一组结构标记(structure tokens),在预训练阶段整合来自多个源域的结构聚合。随后,对于跨域适应,我们设计了 holistic prompts 和 specific prompts 双重提示,分别适配统一的多域结构知识和针对特定域的细粒度信息。最后,我们在七个公开数据集上进行全面实验,以评估和分析SAMGPT的有效性。
引用
@article{arxiv.2502.05424,
title = {SAMGPT: Text-free Graph Foundation Model for Multi-domain Pre-training and Cross-domain Adaptation},
author = {Xingtong Yu and Zechuan Gong and Chang Zhou and Yuan Fang and Hui Zhang},
journal= {arXiv preprint arXiv:2502.05424},
year = {2025}
}
备注
Accepted by WWW2025 Main Track