中文

基于大语言模型(LLM)的图上无标签节点分类

机器学习 2024-02-27 v3 人工智能 计算与语言

摘要

近年来,图神经网络(GNN)在节点分类上取得了显著进展。然而,它们需要大量高质量标签以确保良好性能。相比之下,大语言模型(LLM)在文本属性图上展现出令人印象深刻的零样本能力。但它们在高效处理结构数据方面面临挑战,且推理成本高。鉴于这些观察,本工作引入了基于 LLM 的图上无标签节点分类流水线 LLM-GNN。它融合了 GNN 与 LLM 的优势,同时缓解其局限。具体而言,利用 LLM 标注少量节点,然后在 LLM 标注上训练 GNN 以对剩余大量节点进行预测。LLM-GNN 的实现面临独特挑战:我们如何主动选择节点供 LLM 标注并从而增强 GNN 训练?我们如何利用 LLM 获得高质量、代表性与多样性的标注,从而以更低成本提升 GNN 性能?为应对此挑战,我们开发了标注质量启发式方法,并利用源自 LLM 的置信度分数进行高级节点选择。综合实验结果验证了 LLM-GNN 的有效性。特别地,LLM-GNN 在大规模数据集 \products 上以低于 1 美元的成本达到 74.9% 的准确率。

关键词

引用

@article{arxiv.2310.04668,
  title  = {Label-free Node Classification on Graphs with Large Language Models (LLMS)},
  author = {Zhikai Chen and Haitao Mao and Hongzhi Wen and Haoyu Han and Wei Jin and Haiyang Zhang and Hui Liu and Jiliang Tang},
  journal= {arXiv preprint arXiv:2310.04668},
  year   = {2024}
}

备注

The code is available via https://github.com/CurryTang/LLMGNN; ICLR 2024