中文

众包质量控制统计建模与设计方法技术综述

人机交互 2018-12-10 v1 机器学习

摘要

在线众包提供了一种可扩展且廉价的方式来收集关于各类数据项(如文本、音频、视频)的知识(如标签)。然而,其记录的响应质量方差大,常不能直接用于训练机器学习系统。为解决此问题,已开展大量工作以控制响应质量,使低质量响应不会对机器学习系统性能产生不利影响。此类工作被称为众包质量控制。过去的质量控制研究可分为两大分支:质量控制机制设计与统计模型。第一分支关注设计影响工人行为的支付、游戏化、问题分配及其他机制的度量、阈值、界面与工作流。第二分支关注开发统计模型以有效聚合响应并推断正确响应。两分支相互关联,因为统计模型(i)提供参数估计以支持度量与阈值计算,且(ii)编码用于推导机制(理论)性能保证的建模假设。现有关于各分支的综述缺乏关于另一分支的技术细节。我们的综述首次通过提供技术细节说明两分支在系统统一双方所建众包方面以确定响应质量的框架下如何协同工作,从而桥接两分支。我们也首次基于所提框架给出质量控制论文的分类法。最后,我们指明了当前局限及相应的质量控制研究未来方向。

关键词

引用

@article{arxiv.1812.02736,
  title  = {A Technical Survey on Statistical Modelling and Design Methods for Crowdsourcing Quality Control},
  author = {Yuan Jin and Mark Carman and Ye Zhu and Yong Xiang},
  journal= {arXiv preprint arXiv:1812.02736},
  year   = {2018}
}