将工作者视角纳入 NLP 的 MTurk 标注实践
计算与语言
2023-11-17 v2 人工智能
摘要
当前在亚马逊 Mechanical Turk(MTurk)上针对自然语言处理的数据收集实践,往往依赖于数据质量方面的研究以及 NLP 研究者间共享的启发式方法。然而,若不考虑 MTurk 工作者的视角,这些方法易出现涉及工作者权益与应答质量低下的问题。我们开展了一项批判性文献综述,并对 MTurk 工作者进行了调查,旨在解决有关公平报酬、工作者隐私、数据质量及考量工作者激励等最佳实践方面的开放问题。我们发现,工作者偏好常与 NLP 研究者中的既有共识相悖。受调查工作者偏好可靠、合理的报酬,而非不确定且极高的报酬;报告频繁在人口统计问题上说谎;并对工作被无解释拒收表达沮丧。我们还发现,工作者将某些质量控制方法(如要求最短应答时间或 Master 资格)视为有偏且基本无效。基于调查结果,我们就未来 NLP 研究如何更好地考量 MTurk 工作者的体验以尊重其权利并提升数据质量提供了建议。
引用
@article{arxiv.2311.02802,
title = {Incorporating Worker Perspectives into MTurk Annotation Practices for NLP},
author = {Olivia Huang and Eve Fleisig and Dan Klein},
journal= {arXiv preprint arXiv:2311.02802},
year = {2023}
}