Tobacco3482 数据集中的标签错误
计算机视觉与模式识别
2024-12-18 v1
摘要
Tobacco3482 是一个广泛使用的文档分类基准数据集。然而,我们对整个数据集的人工检查发现了普遍的本体论问题,尤其是数据集中存在大量标注标签问题。我们建立了数据标签规范,发现数据集中 11.7% 的样本标注不当,应具有未知标签或更正后的标签,且 16.7% 的样本具有多个有效标签。随后,我们分析了一个表现顶尖的模型的错误,发现该模型 35% 的错误可直接归因于这些标签问题,凸显了使用带噪标签数据集作为基准的固有问题。补充材料(包括数据集标注和代码)可在 https://github.com/gordon-lim/tobacco3482-mistakes/ 获取。
引用
@article{arxiv.2412.13140,
title = {Label Errors in the Tobacco3482 Dataset},
author = {Gordon Lim and Stefan Larson and Kevin Leach},
journal= {arXiv preprint arXiv:2412.13140},
year = {2024}
}
备注
WACV VisionDocs Workshop 2025