需要询问多少工人?用于收集高质量标签的自适应探索
人工智能
2016-05-20 v3 数据结构与算法
摘要
众包已成为信息检索工具箱的一部分,作为一种廉价且快速的机制,用于获取系统开发和评估所需的标签。大规模成功部署众包涉及调整许多变量,其中非常重要的一个变量是每个人类智能任务 (HIT) 所需的工人数量。我们考虑学习简单多项选择 HIT 答案的众包任务,这类任务代表了许多相关性实验。为了提供具有统计显著性的结果,通常需要询问多个工人来回答同一个 HIT。停止规则是一种算法,给定一个 HIT,它针对任何一组工人答案决定系统是应该停止并输出答案,还是迭代并再询问一名工人。在这种情况下,以质量分数形式了解工人的历史表现是有益的。在本文中,我们研究了如何在给定此类质量分数的情况下设计更好的停止规则。我们还提出自适应探索作为一种可扩展且自动创建真实数据的有前景的方法。我们在一个工业众包平台上进行了数据分析,并利用该分析的观察结果设计了新的停止规则,这些规则以非平凡的方式使用工人的质量分数。随后,我们基于真实世界的工作负载进行了模拟,表明我们的算法优于更朴素的方法。
引用
@article{arxiv.1411.0149,
title = {How Many Workers to Ask? Adaptive Exploration for Collecting High Quality Labels},
author = {Ittai Abraham and Omar Alonso and Vasilis Kandylas and Rajesh Patel and Steven Shelford and Aleksandrs Slivkins},
journal= {arXiv preprint arXiv:1411.0149},
year = {2016}
}
备注
SIGIR 2016