众包中的错误率界限与迭代加权多数投票法
机器学习
2014-11-18 v1 人机交互
机器学习
概率论
统计理论
统计理论
摘要
众包已成为一种有效且流行的人力计算工具,用于标记大规模数据集。由于工作者可能不可靠,众包中通常将多个工作者分配给同一任务,并聚合标签以获得高质量结果。本文在 Dawid-Skene 众包模型下,为一般聚合规则的错误率(概率意义和期望意义下)提供了有限样本指数界限。这些界限适用于多类标记,并可用于分析多种聚合方法,包括多数投票、加权多数投票以及预言机最大后验 (MAP) 规则。我们表明,在特定设定下,预言机 MAP 规则近似优化了加权多数投票平均错误率的上界。我们提出了一种迭代加权多数投票 (IWMV) 方法,该方法优化了错误率界限并近似于预言机 MAP 规则。其单步版本具有可证明的错误率理论保证。IWMV 方法直观且计算简单。在模拟数据和真实数据上的实验结果表明,IWMV 的表现至少与最先进方法相当,且其计算成本远低于最先进方法(快约一百倍)。
引用
@article{arxiv.1411.4086,
title = {Error Rate Bounds and Iterative Weighted Majority Voting for Crowdsourcing},
author = {Hongwei Li and Bin Yu},
journal= {arXiv preprint arXiv:1411.4086},
year = {2014}
}
备注
Journal Submission