当图上的噪声标签遇到类别不平衡:一种结合大语言模型和伪标签的图增强方法
机器学习
2025-07-28 v2 人工智能
摘要
类别不平衡的图节点分类是一个实际但尚未充分探索的研究问题。尽管近期研究试图解决此问题,但它们在处理类别不平衡图时通常假设标签是干净可靠的。这一假设常常违背现实世界图的特性,其中标签经常包含噪声。鉴于这一差距,本文系统研究了带有噪声标签的类别不平衡图的鲁棒节点分类。我们提出了GraphALP,一种基于大语言模型(LLM)和伪标签技术的新型图增强框架。具体来说,我们设计了一种基于LLM的过采样方法来生成合成少数类节点,产生标签准确的少数类节点以缓解类别不平衡。基于类别平衡的图,我们开发了一种动态加权的伪标签方法,以获得高置信度的伪标签来降低标签噪声率。此外,我们实现了一个二次LLM引导的过采样机制,以缓解由伪标签引起的潜在类别分布偏斜。实验结果表明,GraphALP在处理带有噪声标签的类别不平衡图上,其性能优于最先进的方法。
引用
@article{arxiv.2507.18153,
title = {When Noisy Labels Meet Class Imbalance on Graphs: A Graph Augmentation Method with LLM and Pseudo Label},
author = {Riting Xia and Rucong Wang and Yulin Liu and Anchen Li and Xueyan Liu and Yan Zhang},
journal= {arXiv preprint arXiv:2507.18153},
year = {2025}
}