基于大语言模型的少样本图分布外检测
机器学习
2025-03-31 v1 计算与语言
摘要
现有的图分布外(OOD)检测方法通常依赖于使用大量标注的分布内(ID)数据来训练图神经网络(GNN)分类器。然而,在文本属性图(TAG)中,由于其复杂的文本与结构特性,获取高质量的标注节点既困难又成本高昂。大语言模型(LLM)以在文本任务中强大的零样本能力而著称,展现出潜力,但难以自然地捕获 TAG 中固有的关键结构信息,从而限制了其直接使用的效果。为应对这些挑战,我们提出了 LLM-GOOD,一个通用框架,能够有效结合 LLM 与 GNN 的优势,以提升图 OOD 检测中的数据效率。具体而言,我们首先利用 LLM 强大的零样本能力过滤掉可能的 OOD 节点,从而显著降低人工标注负担。为最小化 LLM 的使用量与成本,我们仅让其标注一小部分未标注节点。随后,我们使用这些含噪标签训练一个轻量级的 GNN 过滤器,使其能够利用文本与结构信息对所有其他未标注节点的 ID 状态进行高效预测。在获得 GNN 过滤器的节点嵌入后,我们可以采用基于信息量的方法选择最有价值的节点进行精确的人工标注。最后,我们使用这些精确标注的 ID 节点训练目标 ID 分类器。在四个真实世界 TAG 数据集上的大量实验表明,LLM-GOOD 显著降低了人工标注成本,并在 ID 分类准确率和 OOD 检测性能方面均优于现有最优基线。
引用
@article{arxiv.2503.22097,
title = {Few-Shot Graph Out-of-Distribution Detection with LLMs},
author = {Haoyan Xu and Zhengtao Yao and Yushun Dong and Ziyi Wang and Ryan A. Rossi and Mengyuan Li and Yue Zhao},
journal= {arXiv preprint arXiv:2503.22097},
year = {2025}
}