中文

使用 GPT-3 检测仇恨言论

计算与语言 2022-03-25 v4

摘要

诸如 OpenAI 的 GPT-3 这类精密语言模型能够生成针对边缘群体的仇恨文本。鉴于此能力,我们感兴趣于大型语言模型是否可用于识别仇恨言论并将文本分类为性别歧视或种族主义。我们使用 GPT-3 以零样本、单样本和少样本学习来识别性别歧视和种族主义文本段落。我们发现,在零样本和单样本学习下,GPT-3 识别性别歧视或种族主义文本的平均准确率在 55% 到 67% 之间,具体取决于文本类别和学习类型。在少样本学习下,模型准确率可高达 85%。大型语言模型在仇恨言论检测中可发挥作用,经进一步开发,它们最终或可用于对抗仇恨言论。

关键词

引用

@article{arxiv.2103.12407,
  title  = {Detecting Hate Speech with GPT-3},
  author = {Ke-Li Chiu and Annie Collins and Rohan Alexander},
  journal= {arXiv preprint arXiv:2103.12407},
  year   = {2022}
}

备注

29 pages, 1 figure, 23 tables 24 March 2022: Re-submission changes the modelling to occur multiple times and adds standard errors