众包中跨微任务资格测试有效性的探索
人机交互
2020-12-22 v1
摘要
众包中的资格测试常通过衡量工作者执行微任务的能力来预先筛选工作者。尽管为每种任务类型创建资格测试被视为常见且合理的方式,本研究探讨了当同一资格测试用于多种任务类型时其工作者筛选表现。在 Amazon Mechanical Turk 上,我们测试了六种不同情形下的标注准确率,这些任务由来自同一真实领域、具有两种不同难度水平组成:资格测试与实际任务相同或不同的四种组合情形,以及另外两种仅要求具有 Masters Qualification 的工作者执行实际任务的情形。实验结果显示以下两点发现:i) 被分配困难资格测试的工作者无论实际任务难度如何均获得更好的标注准确率;ii) 具有 Masters Qualification 的工作者在低难度任务上标注准确率更高,但在高难度任务上不如通过资格测试的工作者准确。
引用
@article{arxiv.2012.10999,
title = {Exploring Effectiveness of Inter-Microtask Qualification Tests in Crowdsourcing},
author = {Masaya Morinaga and Susumu Saito and Teppei Nakano and Tetsunori Kobayashi and Tetsuji Ogawa},
journal= {arXiv preprint arXiv:2012.10999},
year = {2020}
}