中文

CleanPatrick:图像数据清洗基准

计算机视觉与模式识别 2025-05-19 v1 人工智能 机器学习

摘要

稳健的机器学习依赖于干净的数据,但当前的图像数据清洗基准依赖于合成噪声或狭窄的人类研究,限制了比较和现实相关性。我们引入 CleanPatrick,这是第一个面向图像领域的数据清洗大规模基准,基于公开可用的 Fitzpatrick17k 皮肤科学数据集构建。我们收集了来自933名医学众包工作者的496,377条二进制注释,识别出离题样本(4%)、近重复样本(21%)和标签错误(22%),并采用受项目反应理论启发的聚合模型,再经专家审核,以获得高质量的真实标签。CleanPatrick 将问题检测 formalization 为排序任务,并采用典型的排序指标模拟实际审计工作流程。对经典异常检测器、感知哈希、SSIM、Confident Learning、NoiseRank 和 SelfClean 进行基准测试,我们发现在 CleanPatrick 上,自监督表示在近重复检测方面表现突出,经典方法在受限审查预算下实现了具竞争力的离题检测,而标签错误检测在细粒度医学分类中仍是一个开放性挑战。通过发布数据集和评估框架,CleanPatrick 使能够系统比较图像清洗策略,为更可靠的数据中心人工智能铺平了道路。

关键词

引用

@article{arxiv.2505.11034,
  title  = {CleanPatrick: A Benchmark for Image Data Cleaning},
  author = {Fabian Gröger and Simone Lionetti and Philippe Gottfrois and Alvaro Gonzalez-Jimenez and Ludovic Amruthalingam and Elisabeth Victoria Goessinger and Hanna Lindemann and Marie Bargiela and Marie Hofbauer and Omar Badri and Philipp Tschandl and Arash Koochek and Matthew Groh and Alexander A. Navarini and Marc Pouly},
  journal= {arXiv preprint arXiv:2505.11034},
  year   = {2025}
}