中文

大规模众包高效数据收集的实践

人机交互 2019-12-11 v1

摘要

现代机器学习算法需要大型数据集进行训练。相较于有限专家所需,众包已成为在更短时间、更低成本下标注大型数据集的流行方法。然而,由于众包执行者非专业且专业水平不一,此类标注比专家标注噪声大得多。因此,为在有限预算内收集优质数据,需使用增量重标、聚合与定价等特殊技术。我们介绍通过公共众包市场进行数据标注,并呈现高效标注收集的关键组件。我们展示如何选取真实标注收集任务之一,试验标注流程设置选择,并在最大的众包市场之一 Yandex.Toloka 启动标注收集项目。项目将在真实众包群体上运行。我们还呈现众包中聚合、增量重标与定价的主要算法。特别地,我们第一讨论了如何连接这三个组件构建高效标注收集流程;第二分享了应用这些算法与构建大规模标注收集流水线的丰富工业经验(强调最佳实践与常见陷阱)。

关键词

引用

@article{arxiv.1912.04444,
  title  = {Practice of Efficient Data Collection via Crowdsourcing at Large-Scale},
  author = {Alexey Drutsa and Viktoriya Farafonova and Valentina Fedorova and Olga Megorskaya and Evfrosiniya Zerminova and Olga Zhilinskaya},
  journal= {arXiv preprint arXiv:1912.04444},
  year   = {2019}
}

备注

9 pages, 9 figures