中文

利用大语言模型进行文本属性图少样本学习中的节点生成

机器学习 2024-12-11 v2

摘要

文本属性图因其在网络领域的广泛应用而近期受到显著关注。现有方法采用词嵌入模型获取文本表示作为节点特征,随后将其输入图神经网络(GNNs)进行训练。近年来,大语言模型(LLMs)的出现引入了其在信息检索和文本生成方面的强大能力,可极大增强图数据的文本属性。此外,大规模数据集的获取与标注既昂贵又耗时。因此,少样本学习已成为图学习任务中的一个关键问题。为应对该挑战,我们提出了一种称为 LLM4NG 的轻量级范式,其采用即插即用的方式,通过利用 LLMs 进行节点生成来增强文本属性图。具体而言,我们利用 LLMs 从标签中提取语义信息,并生成属于这些类别的样本作为示例。随后,我们采用边预测器捕获原始数据集中固有的结构信息,并将新生成的样本整合到原始图中。该方法借助 LLMs 增强类别级信息,并在不修改原始数据集的情况下无缝引入带标签的节点和边,从而 facilitat 少样本场景下的节点分类任务。大量实验证明了我们所提范式的优异性能,尤其在低样本场景下。例如,在 ogbn-arxiv 数据集的 1-shot 设定下,LLM4NG 相比基线模型实现了 76% 的提升。

关键词

引用

@article{arxiv.2310.09872,
  title  = {Leveraging Large Language Models for Node Generation in Few-Shot Learning on Text-Attributed Graphs},
  author = {Jianxiang Yu and Yuxiang Ren and Chenghua Gong and Jiaqi Tan and Xiang Li and Xuecang Zhang},
  journal= {arXiv preprint arXiv:2310.09872},
  year   = {2024}
}

备注

Accepted by AAAI2025