中文

语言模型的有害言论检测表现出性别酷儿方言偏见

计算与语言 2024-06-25 v2 计算机与社会

摘要

社交媒体平台上的内容审核塑造了在线话语的动态,影响着哪些声音被放大、哪些被压制。最近的研究引发了对内容审核实践公平性的担忧,特别是对于激进地将跨性别者和非二元性别者的帖子标记为有害。在本研究中,我们调查了在线性别酷儿方言的有害言论分类中存在的偏见,重点关注对回收污名化词语的处理。我们引入了一个新的数据集QueerReclaimLex,该数据集基于109个精心策划的模板,展示了LGBTQ+污名化词语的非贬义用法。数据集实例由性别酷儿标注者根据关于说话者身份的额外上下文进行潜在危害评分。我们系统地评估了五个现成语言模型在评估这些文本危害性方面的性能,并探索了思维链提示在教导大型语言模型(LLM)利用作者身份上下文方面的有效性。我们揭示了这些模型倾向于错误地将性别酷儿个体撰写的文本标记为有害。引人注目的是,在所有LLM中,对于显示出由所涉污名化词语目标群体撰写的文本,其性能最差(F1 <= 0.24)。我们强调了内容审核系统对公平性和包容性的迫切需求。通过揭示这些偏见,这项工作旨在为开发更公平的内容审核实践提供信息,并为所有用户创造包容性的在线空间做出贡献。

关键词

引用

@article{arxiv.2406.00020,
  title  = {Harmful Speech Detection by Language Models Exhibits Gender-Queer Dialect Bias},
  author = {Rebecca Dorn and Lee Kezar and Fred Morstatter and Kristina Lerman},
  journal= {arXiv preprint arXiv:2406.00020},
  year   = {2024}
}