中文

ground-truth,谁之真相?——审视有毒文本数据集标注的挑战

计算与语言 2021-12-08 v1

摘要

基于机器学习(ML)的语言模型(LMs)用于在线内容监控日益增多。对于有毒文本识别,通过使用标注者提供ground-truth标签以区分攻击性与正常内容的数据集,对这些模型进行任务特定的微调。这些项目随时间推进了大型数据集的开发、改进与扩展,并为自然语言研究作出巨大贡献。尽管成就显著,现有证据表明基于这些数据集构建的ML模型并非总能产生理想结果。因此,本研究采用设计科学研究(DSR)方法,考察若干选定的有毒文本数据集,旨在揭示其中一些固有议题,并为现有与未来项目应对这些挑战的讨论作出贡献。为实现研究目标,我们对三个有毒文本数据集的样本重新标注,发现对有毒文本样本采用多标签标注方法有助于提升数据集质量。尽管该方法未必改善标注者间一致性的传统指标,但能更好地捕捉对上下文的依赖与标注者的多样性。我们讨论了这些结果对理论与实践的启示。

关键词

引用

@article{arxiv.2112.03529,
  title  = {Ground-Truth, Whose Truth? -- Examining the Challenges with Annotating Toxic Text Datasets},
  author = {Kofi Arhin and Ioana Baldini and Dennis Wei and Karthikeyan Natesan Ramamurthy and Moninder Singh},
  journal= {arXiv preprint arXiv:2112.03529},
  year   = {2021}
}

备注

15 pages