众包最优速率中的精确指数
机器学习
2016-05-27 v2 统计理论
统计理论
摘要
在许多机器学习应用中,众包已成为标签收集的主要手段。本文研究聚合一组非专家工作者所提供标签的最优错误率。在经典的 Dawid-Skene 模型下,我们建立了匹配的上界和下界,并带有一个精确指数 ,其中 是工作者数量, 是刻画工作者集体能力的平均 Chernoff 信息。这种对错误指数的精确刻画使我们能够给出一个精确的样本量要求 ,以达到 的误分类错误。此外,我们的结果暗示了各种由一致估计量初始化的众包 EM 算法的最优性。
引用
@article{arxiv.1605.07696,
title = {Exact Exponent in Optimal Rates for Crowdsourcing},
author = {Chao Gao and Yu Lu and Dengyong Zhou},
journal= {arXiv preprint arXiv:1605.07696},
year = {2016}
}
备注
To appear in the Proceedings of the 33rd International Conference on Machine Learning, New York, NY, USA, 2016