中文

在大型图语料上进行图感知语言模型预训练可助力多种图应用

计算与语言 2023-06-06 v1 人工智能 机器学习

摘要

在大型文本语料上的模型预训练已被证明对NLP领域的各类下游应用有效。在图挖掘领域,可类比地在大型图上进行图模型预训练,以期惠及下游图应用,近期若干研究亦对此进行了探索。然而,现有研究均未考察在富含文本信息的大型异质图(即大型图语料)上预训练文本加图模型,并在具有不同图模式的相关下游应用上微调该模型。为解决此问题,我们提出一种在大型图语料上进行图感知语言模型预训练(GALM)的框架,其融合了大型语言模型与图神经网络,并包含多种下游应用微调方法。我们在亚马逊真实内部数据集与大型公开数据集上开展了充分实验。综合实证结果与深入分析证明了所提方法的有效性及经验教训。

关键词

引用

@article{arxiv.2306.02592,
  title  = {Graph-Aware Language Model Pre-Training on a Large Graph Corpus Can Help Multiple Graph Applications},
  author = {Han Xie and Da Zheng and Jun Ma and Houyu Zhang and Vassilis N. Ioannidis and Xiang Song and Qing Ping and Sheng Wang and Carl Yang and Yi Xu and Belinda Zeng and Trishul Chilimbi},
  journal= {arXiv preprint arXiv:2306.02592},
  year   = {2023}
}

备注

To be published in the KDD 2023 proceedings as a full paper