中文

从自然语言处理的公民科学项目中学到的经验

计算与语言 2023-04-26 v1

摘要

许多自然语言处理(NLP)系统使用标注语料库进行训练和评估。然而,标注数据的获取通常代价高昂且难以扩展标注项目规模,这就是为什么标注任务常被外包给有偿众包工作者。公民科学是众包的一种替代方案,在 NLP 背景下相对未被探索。为调查公民科学是否及如何在这一设定下适用,我们通过重新标注一个已有众包数据集的部分内容,开展了一项关于让不同志愿者群体参与 NLP 公民科学的探索性研究。我们的结果表明,这能产生高质量标注并吸引有积极性的志愿者,但也需要考虑可扩展性、随时间参与的持续性以及法律与伦理问题等因素。我们以指南形式总结了经验教训,并提供我们的代码与数据以助未来的公民科学研究。

关键词

引用

@article{arxiv.2304.12836,
  title  = {Lessons Learned from a Citizen Science Project for Natural Language Processing},
  author = {Jan-Christoph Klie and Ji-Ung Lee and Kevin Stowe and Gözde Gül Şahin and Nafise Sadat Moosavi and Luke Bates and Dominic Petrak and Richard Eckart de Castilho and Iryna Gurevych},
  journal= {arXiv preprint arXiv:2304.12836},
  year   = {2023}
}

备注

Accepted to EACL 2023. Code will be published on github: https://github.com/UKPLab/eacl2023-citizen-science-lessons-learned