中文

将众包视为考试:如何对任务和在线工作者进行评分?

人机交互 2022-04-28 v1 数据库 机器学习

摘要

众包是一种在线外包模式,能够解决当前机器学习算法对海量标注数据的迫切需求。请求者在众包平台上发布任务,平台雇佣互联网上的在线工作者完成任务,然后汇总结果并返回给请求者。如何对不同类型的工人与任务之间的交互进行建模是一个热点问题。本文尝试根据能力将工人建模为四种类型:专家、普通工人、马虎工人和垃圾邮件发送者,并根据难度将任务分为困难、中等和简单任务。我们认为,即使是专家也会在困难任务上遇到困难,而马虎工人可以正确完成简单任务,垃圾邮件发送者则总是故意给出错误答案。因此,好的考试任务应具有适中的难度和区分度,以便更客观地对工人进行评分。因此,我们首先主要根据中等难度任务对工人的能力进行评分,然后在推断任务的真值时,降低马虎工人答案的权重并修正垃圾邮件发送者的答案。我们采用概率图模型来模拟任务执行过程,并采用迭代方法依次计算和更新真值、工人的能力以及任务的难度。我们在模拟和真实众包场景中验证了算法的正确性和有效性。

关键词

引用

@article{arxiv.2204.13065,
  title  = {Treating Crowdsourcing as Examination: How to Score Tasks and Online Workers?},
  author = {Guangyang Han and Sufang Li and Runmin Wang and Chunming Wu},
  journal= {arXiv preprint arXiv:2204.13065},
  year   = {2022}
}