中文

若在众包数据标注流程中使用 GPT-4

人机交互 2024-07-02 v2 人工智能 计算与语言 机器学习

摘要

近期研究表明,GPT-4 在数据标注准确率方面优于在线众包工作者,尤其是来自 Amazon Mechanical Turk (MTurk) 的工作者。然而,这些研究因偏离标准众包实践且强调个体工作者表现而非整个数据标注流程而受到批评。本文对比了 GPT-4 与一个符合伦理且执行良好的 MTurk 流程,其中 415 名工作者使用 CODA-19 方案对 200 篇学术文章中的 3,177 个句子片段进行了标注。两种工作者界面产生了 127,080 个标签,随后通过八种标签聚合算法推断出最终标签。我们的评估显示,尽管采用了最佳实践,MTurk 流程的最高准确率仅为 81.5%,而 GPT-4 达到了 83.6%。有趣的是,当将 GPT-4 的标签与通过高级工作者界面收集的众包标签结合进行聚合时,8 种算法中有 2 种实现了更高的准确率(87.5% 和 87.0%)。进一步分析表明,当众包和 GPT-4 的标注优势互补时,聚合它们可以提高标注准确率。

关键词

引用

@article{arxiv.2402.16795,
  title  = {If in a Crowdsourced Data Annotation Pipeline, a GPT-4},
  author = {Zeyu He and Chieh-Yang Huang and Chien-Kuang Cornelia Ding and Shaurya Rohatgi and Ting-Hao 'Kenneth' Huang},
  journal= {arXiv preprint arXiv:2402.16795},
  year   = {2024}
}

备注

Accepted By CHI 2024