LLM标注者失败之处:利用LLM进行图上无标签学习
机器学习
2026-05-28 v1
摘要
图上的节点分类通常需要标注节点,然而在图规模上获取标签成本高昂。当节点属性包含语义内容(如论文摘要、网页或产品描述)时,大语言模型(LLM)可以通过标注一小部分节点来提供低成本的监督。然而,这些LLM生成的标签是有噪声的,现有的无标签图学习方法通常将此噪声视为全局性的或类别条件性的。我们发现LLM的标注错误不仅依赖于类别,还依赖于区域:在同一类别内,可靠性在特征空间的不同簇之间可能有显著差异。鉴于此,我们提出了簇感知噪声估计(CANE),这是一种无标签学习框架,它在没有真实标签的情况下估计簇条件性的LLM可靠性,并利用此估计来决定信任哪些伪标签以及纠正哪些标签。在各种图基准和GNN骨干网络上,CANE优于最强的无标签基线,在表现出更强簇条件性噪声的数据集上取得了最大的提升。
引用
@article{arxiv.2605.27913,
title = {Where LLM Annotators Fail: Label-Free Learning on Graphs with LLMs},
author = {Safal Thapaliya and Jiatan Huang and Chuxu Zhang},
journal= {arXiv preprint arXiv:2605.27913},
year = {2026}
}