利用基于深度学习的方法误导众包标注群体
人机交互
2019-12-03 v1
摘要
现代最先进的深度学习方法在众多目标检测与分类任务中达到了类人的性能。其成功的基础是大量训练数据集的可用性和可获得性,这类数据集的创建成本高昂,尤其在医学影像领域。近来,众包已被应用于为广泛学科创建大型数据集。本研究旨在探索在细胞学全切片图像分级这一目标检测任务中,众包与算法协作所面临的挑战与机遇。我们将二十名参与者的经典众包表现与其在众包-算法协作下的结果进行了比较。所有参与者以随机顺序在同一二十张图像上完成了两种模式。此外,我们在预计算标注中引入了人为系统性缺陷,以估计对接受预计算标注的偏向。我们从二十名按细胞学专业水平分为四组的参与者处收集了800张图像上的9524个标注。众包-算法模式使参与者的分类准确率平均提高7%,平均精度均值提高8%,观察者间Fleiss' kappa分数提高20%,并将耗时减少31%。然而,三分之二的人为修改的错误标签未被贡献者识别出来。本研究表明,在确保精心设计的设置消除潜在偏倚的前提下,众包-算法协作是一种有前景的用于生成大型数据集的新方法。
引用
@article{arxiv.1912.00142,
title = {Fooling the Crowd with Deep Learning-based Methods},
author = {Christian Marzahl and Marc Aubreville and Christof A. Bertram and Stefan Gerlach and Jennifer Maier and Jörn Voigt and Jenny Hill and Robert Klopfleisch and Andreas Maier},
journal= {arXiv preprint arXiv:1912.00142},
year = {2019}
}
备注
6 pages, accepted at BVM 2020