中文

在众包中通过自适应方案实现预算最优性

机器学习 2017-08-28 v3 人机交互 社会与信息网络 机器学习

摘要

众包平台提供了市场,任务请求者可以付费获取其数据的标签。此类市场近年来已成为收集标注的热门场所,这些标注在各种应用中训练机器学习模型时至关重要。然而,由于工作枯燥且报酬低廉,此类众包标签中错误常见。克服答案噪声的一种常见策略是通过为每个任务获取多个答案并使用诸如多数投票的某些方法进行聚合来添加冗余。对于这样的系统,有一个根本性的关注问题:在我们可以收集的响应数量固定的预算下,如何最大化准确率。我们刻画了预算(请求者总共能收集的回答数)与估计标签准确率之间的基本权衡。特别地,我们探究自适应任务分配方案是否会导致准确率与预算之间更高效的权衡。自适应方案根据迄今收集的数据自适应地分配任务,在实用众包系统中被广泛使用以高效利用给定固定预算。然而,现有对众包系统的理论分析表明自适应任务分配的收益微乎其微。为弥合这一差距,我们在严格更通用的概率模型下研究此问题,该模型最近被引入以建模实际众包标注。在此广义 Dawid-Skene 模型下,我们刻画了预算与准确率之间的基本权衡。我们提出了一种匹配该基本极限的新颖自适应方案。进一步,我们通过将该权衡与非负自适应方案的权衡进行比较,量化了自适应与非自适应方案之间的基本差距。我们的分析证实该差距显著。

关键词

引用

@article{arxiv.1602.03481,
  title  = {Achieving Budget-optimality with Adaptive Schemes in Crowdsourcing},
  author = {Ashish Khetan and Sewoong Oh},
  journal= {arXiv preprint arXiv:1602.03481},
  year   = {2017}
}

备注

32 pages, 4 figures