中文

测量自然语言生成中的厌女症:来自两个 Reddit 社区案例研究的初步结果

计算与语言 2023-12-07 v1 计算机与社会 机器学习

摘要

尽管越来越多的证据表明通用“毒性”分类器存在缺陷,但它们仍被用于评估自然语言生成中造成伤害的潜力。我们考虑了测量自然语言生成中厌女症的挑战,并认为通用“毒性”分类器不足以完成此任务。我们使用来自 Reddit 上两个特征明确的“Incel”社区的数据,这两个社区主要在厌女程度上存在差异,构建了一对训练语料库,并用它们来微调两个语言模型。我们展示了一个开源“毒性”分类器无法有意义地区分这些模型的生成内容。我们将其与女权主义领域专家最近提出的一个厌女症特定词典进行对比,证明尽管基于词典的简单方法存在局限性,但该词典显示出作为评估语言模型厌女症基准的潜力,并且它足够灵敏,能够揭示这些 Reddit 社区中的已知差异。我们的初步发现突显了通用方法评估危害的局限性,并进一步强调了在自然语言评估中谨慎设计和选择基准的必要性。

关键词

引用

@article{arxiv.2312.03330,
  title  = {Measuring Misogyny in Natural Language Generation: Preliminary Results from a Case Study on two Reddit Communities},
  author = {Aaron J. Snoswell and Lucinda Nelson and Hao Xue and Flora D. Salim and Nicolas Suzor and Jean Burgess},
  journal= {arXiv preprint arXiv:2312.03330},
  year   = {2023}
}

备注

This extended abstract was presented at the Generation, Evaluation and Metrics workshop at Empirical Methods in Natural Language Processing in 2023 (GEM@EMNLP 2023) in Singapore