中文

利用大语言模型在文本属性图中实现有效的无标签节点分类

机器学习 2025-05-19 v3 人工智能

摘要

图神经网络(GNN)由于其整合图结构和属性的强大能力,已成为图数据节点分类的首选模型。然而,这些模型严重依赖大量高质量的标注数据进行训练,而获取这些数据的成本通常很高。随着大语言模型(LLM)的兴起,一种有前景的方法是利用其出色的零样本能力和丰富的知识进行节点标注。尽管取得了令人鼓舞的结果,但这种方法要么需要对LLM进行大量查询,要么会因为LLM生成的噪声标签而导致性能下降。为了应对这些挑战,我们引入了Locle,这是一个主动自训练框架,能够以低成本使用LLM进行无标签节点分类。Locle迭代地使用GNN识别少量“关键”样本,并利用LLM和GNN为它们提取信息丰富的伪标签,作为额外的监督信号来增强模型训练。具体而言,Locle包含三个关键组件:(i)用于初始标注的有效主动节点选择策略;(ii)基于标签不和谐性和熵的精细样本选择方案,以识别“关键”节点;(iii)结合LLM和GNN以及重构拓扑的标签细化模块。在五个基准文本属性图数据集上的广泛实验表明,在对LLM的相同查询预算下,Locle在无标签节点分类方面显著优于SOTA方法。值得注意的是,在包含14.3k个节点的DBLP数据集上,Locle以不到一美分的成本实现了比SOTA高8.08%的准确率。我们的代码可在 https://github.com/HKBU-LAGAS/Locle 获取。

关键词

引用

@article{arxiv.2412.11983,
  title  = {Leveraging Large Language Models for Effective Label-free Node Classification in Text-Attributed Graphs},
  author = {Taiyan Zhang and Renchi Yang and Yurui Lai and Mingyu Yan and Xiaochun Ye and Dongrui Fan},
  journal= {arXiv preprint arXiv:2412.11983},
  year   = {2025}
}

备注

Accepted by SIGIR2025