基于大语言模型的粗到细开集图节点分类
机器学习
2025-12-23 v2 人工智能
摘要
开发能够在分布内(ID)数据上进行分类同时检测分布外(OOD)样本的开集分类方法,对于将图神经网络(GNN)部署于开放世界场景至关重要。现有方法通常将所有OOD样本视为单一类别,尽管现实应用,尤其是欺诈检测和医疗诊断等高风险场景,要求对OOD样本进行更深入的分析,包括其可能的标签。这引发了一个关键问题:在没有真实标签信息的情况下,能否将OOD检测扩展为OOD分类?为回答这一问题,我们提出了一个利用大语言模型(LLM)进行图数据集的粗到细分类(CFC)框架。CFC包含三个关键组件:一个利用LLM提示进行OOD检测和异常标签生成的粗分类器,一个由粗分类器识别的OOD样本训练的基于GNN的细分类器,用于增强OOD检测和ID分类,以及通过LLM提示和后处理OOD标签实现的精细化OOD分类。与依赖合成或辅助OOD样本的方法不同,CFC采用基于其固有语义 genuinely 分布外的OOD实例,提高了可解释性和实际效用。实验结果表明,CFC在图和文本领域上将OOD检测性能提升了百分之十,在图数据集上实现了高达百分之七十的OOD分类准确率。
引用
@article{arxiv.2512.16244,
title = {Coarse-to-Fine Open-Set Graph Node Classification with Large Language Models},
author = {Xueqi Ma and Xingjun Ma and Sarah Monazam Erfani and Danilo Mandic and James Bailey},
journal= {arXiv preprint arXiv:2512.16244},
year = {2025}
}
备注
Accepted to AAAI 2026