高效人工计算
机器学习
2009-03-09 v1
摘要
收集大型标注数据集是一项费时费力的任务,其规模化需要将标注工作分配给多个教师。当类别数量很大时,不同教师给出的标签之间很可能出现不一致,在极端情况下甚至可能达到完全不一致。在本文中,我们描述了如何在缺乏教师协调的情况下获得全局一致的标签,并讨论了这一过程在人力方面的可能效率。我们定义了一个标签效率的概念,用于衡量获得的全局一致标签数量与分布式教师提供的标签数量之比。我们表明,效率关键取决于单个教师看到的数据实例数量与类别数量之比α。我们针对分布式标注问题提出了几种算法,并分析了它们作为α函数的效率。此外,我们为完全无协调教师的情况提供了标签效率的上界,并表明当每个教师提供的标签数量与类别数量之比下降时(即α趋近于0),效率趋近于0。
引用
@article{arxiv.0903.1125,
title = {Efficient Human Computation},
author = {Ran Gilad-Bachrach and Aharon Bar-Hillel and Liat Ein-Dor},
journal= {arXiv preprint arXiv:0903.1125},
year = {2009}
}
备注
8 pages, 1 figure