NLP相关众包HIT调查:何者有效与何者无效
计算与语言
2021-11-10 v1
摘要
Amazon Mechanical Turk (AMT) 上的众包请求者已对工人的可靠性提出质疑。AMT 劳动力非常多样化,不可能对他们作为一个群体做出一概而论的假设。一些请求者在未得到预期结果时会大规模拒绝工作。这导致每个工人(无论好坏)获得更低的人智任务 (Human Intelligence Task, HIT) 批准分数,对好工人而言是不公平的。这也导致请求者在工人论坛上声誉不佳。造成大规模拒绝的某些问题源于请求者未花时间创建带有完整说明的良构任务和/或未支付公平工资。为探究此假设,本文描述了一项研究,考察给定时间段内 AMT 上可用的众包 HIT 并记录这些 HIT 的信息。本研究还从一个众包论坛记录了工人对这些 HIT 及其对应请求者的看法信息。结果揭示了工人薪酬与呈现方面的问题,例如缺失说明或无法完成的 HIT。
引用
@article{arxiv.2111.05241,
title = {A Survey of NLP-Related Crowdsourcing HITs: what works and what does not},
author = {Jessica Huynh and Jeffrey Bigham and Maxine Eskenazi},
journal= {arXiv preprint arXiv:2111.05241},
year = {2021}
}