众包模型中的错误率界
机器学习
2013-07-11 v1 机器学习
应用统计
摘要
众包是解决许多对计算机而言具有挑战性任务的有效人力计算工具。在本文中,我们在 Dawid-Skene 众包模型下,为超平面二分类标记规则的错误率(概率意义下和期望意义下)提供了有限样本指数界。这些界可应用于分析许多常见的预测方法,包括多数投票和加权多数投票。这些界的结果可用于控制错误率并设计更好的算法。我们表明,对于任何超平面二分类标记规则,Oracle 最大后验(MAP)规则近似优化了平均错误率的上界,并提出了一种简单的数据驱动加权多数投票(WMV)规则(称为单步 WMV),该规则试图逼近 Oracle MAP 并在错误率上具有可证明的理论保证。此外,我们利用模拟数据和真实数据表明,数据驱动的 EM-MAP 规则是 Oracle MAP 规则的良好近似,并且数据驱动 EM-MAP 规则的平均错误率也受限于将估计参数代入界后得到的 Oracle MAP 规则的平均错误率界。
引用
@article{arxiv.1307.2674,
title = {Error Rate Bounds in Crowdsourcing Models},
author = {Hongwei Li and Bin Yu and Dengyong Zhou},
journal= {arXiv preprint arXiv:1307.2674},
year = {2013}
}
备注
13 pages, 3 figures, downloadable supplementary files