中文

GraphCleaner:在流行图学习基准中检测错误标注样本

机器学习 2023-06-02 v1 人工智能

摘要

标签错误已被发现普遍存在于流行的文本、视觉和音频数据集中,严重影响了机器学习算法的安全开发与评估。尽管针对图像和文本等通用数据类型质量提升的努力不断增加,图数据中错误标签检测的问题仍未被充分探索。为弥补这一差距,我们探究了流行真实世界图数据集中的错误标注问题,并提出了GraphCleaner——一种用于检测并纠正图数据集中这些错误标注节点的后验方法。GraphCleaner结合了以下新颖思路:1)合成错误标签数据集生成,旨在生成逼真的错误标签;2)邻域感知错误标签检测,在标签和基分类器预测中均利用邻域依赖性。在6个数据集和6种实验设置上的实证评估表明,GraphCleaner优于最接近的基线,F1分数平均提升0.14,MCC平均提升0.16。在真实数据案例研究中,GraphCleaner检测出了流行图基准(PubMed、Cora、CiteSeer和OGB-arxiv)中真实且先前未知的错误标签;我们发现至少6.91%的PubMed数据被错误标注或存在歧义,而仅移除这些错误标注数据就能将评估性能从86.71%提升至89.11%。

关键词

引用

@article{arxiv.2306.00015,
  title  = {GraphCleaner: Detecting Mislabelled Samples in Popular Graph Learning Benchmarks},
  author = {Yuwen Li and Miao Xiong and Bryan Hooi},
  journal= {arXiv preprint arXiv:2306.00015},
  year   = {2023}
}

备注

ICML 2023