利用人机交互提升计算机视觉数据集质量
计算机视觉与模式识别
2024-02-01 v1
摘要
大规模单标签多类别分类数据集(如 ImageNet-1k)在推动深度学习和计算机视觉发展方面发挥了重要作用。然而,一个关键但常被忽视的方面是对这些数据集的全面质量评估,尤其是关于潜在的多标签标注错误。本文中,我们引入了一个轻量级、用户友好且可扩展的框架,该框架协同人类与机器智能以实现高效的数据集验证与质量提升。我们将这一新颖框架命名为 Multilabelfy。Multilabelfy 的核心是一个自适应的网络平台,它系统地引导标注者完成重新评估过程,有效利用人机交互来提升数据集质量。通过在 ImageNetV2 数据集上使用 Multilabelfy,我们发现约 47.88% 的图像包含至少两个标签,凸显了对这类有影响力的数据集进行更严格评估的必要性。此外,我们的分析显示,每张图像的潜在标签数量与模型的 top-1 准确率之间存在负相关,揭示了模型评估与选择中的一个关键因素。我们的开源框架 Multilabelfy 为数据集增强提供了一种便捷、轻量级的解决方案,重点关注多标签比例。本研究解决了数据集完整性方面的主要挑战,并为模型性能评估提供了关键见解。此外,它强调了整合人类专业知识与机器能力以产生更稳健模型和可信数据开发的优势。Multilabelfy 的源代码将在 https://github.com/esla/Multilabelfy 上发布。
引用
@article{arxiv.2401.17736,
title = {Leveraging Human-Machine Interactions for Computer Vision Dataset Quality Enhancement},
author = {Esla Timothy Anzaku and Hyesoo Hong and Jin-Woo Park and Wonjun Yang and Kangmin Kim and JongBum Won and Deshika Vinoshani Kumari Herath and Arnout Van Messem and Wesley De Neve},
journal= {arXiv preprint arXiv:2401.17736},
year = {2024}
}