中文

消除偏见以拥抱多样性:面向有害语言的全面标注基准

计算与语言 2024-10-18 v1

摘要

本研究提出一种基于人文研究的规范性标注基准,以确保对具备非主流语言使用的冒犯性语言进行一致且无偏见的标注。我们贡献了两个新标注的数据集,相较于基于描述性指令的原始数据集,实现了更高的人类标注者与语言模型(LLM)标注之间的一致性。我们的实验表明,LLM 可在专业标注者不可得时发挥有效作用。此外,针对多来源 LLM 标注数据微调的小型模型在性能上优于基于单一来源人类标注数据训练的模型。这些发现凸显了结构化指南在降低主观变异性、在有限数据下保持性能以及拥抱语言多样性方面的价值。内容警告:本文仅用于学术目的,对具备冒犯性语言进行分析,需谨慎阅读。

关键词

引用

@article{arxiv.2410.13313,
  title  = {Mitigating Biases to Embrace Diversity: A Comprehensive Annotation Benchmark for Toxic Language},
  author = {Xinmeng Hou},
  journal= {arXiv preprint arXiv:2410.13313},
  year   = {2024}
}

备注

12 pages, 9 figures, EMNLP-NLP4DH 2024