中文

Kaputt:面向视觉缺陷检测的大规模数据集

计算机视觉与模式识别 2025-10-08 v1 人工智能 机器学习

摘要

我们提出一种新型大规模数据集,用于物流场景下的缺陷检测。近期工业异常检测工作主要聚焦于姿态高度受控且类别有限的制造场景。现有基准如 MVTec-AD [6] 和 VisA [33] 已趋于饱和,SOTA 方法达到最高 99.9% AUROC 分数。与制造场景不同,零售物流的异常检测面临姿态和外观多样性更大的新挑战。现有主流方法在此场景下表现不足。为弥合这一差距,我们引入新基准,克服现有数据集的局限性。数据集包含 23 万余张图像(超过 29 万个缺陷实例),规模是 MVTec-AD 的 40 倍,包含 4.8 万种独立物体。为验证问题难度,我们对多种 SOTA 异常检测方法进行广泛评估,证明它们在本数据集上最高也仅达 56.96% AUROC。进一步的定性分析确认现有方法在强姿态和外观变异下难以利用正常样本。有了本大规模数据集,我们设定新基准,鼓励未来研究解决零售物流异常检测中的这一挑战。数据集可在 https://www.kaputt-dataset.com 下载。

关键词

引用

@article{arxiv.2510.05903,
  title  = {Kaputt: A Large-Scale Dataset for Visual Defect Detection},
  author = {Sebastian Höfer and Dorian Henning and Artemij Amiranashvili and Douglas Morrison and Mariliza Tzes and Ingmar Posner and Marc Matvienko and Alessandro Rennola and Anton Milan},
  journal= {arXiv preprint arXiv:2510.05903},
  year   = {2025}
}

备注

Accepted to ICCV 2025