面向仇恨言论检测的生成式人工智能:评估与发现
计算与语言
2023-11-17 v1 人工智能
摘要
使用深度神经模型自动检测仇恨言论受限于标注数据的稀缺,导致泛化能力差。为缓解此问题,生成式人工智能已被用于从现有标注样本中生成大量合成仇恨言论序列,并利用生成的数据微调大型预训练语言模型(LLM)。在本章中,我们回顾了相关方法、实验设置以及对这一方法的评估。除通用LLM(如BERT、RoBERTa和ALBERT)外,我们还应用并评估了使用已适配仇恨检测的LLM(包括RoBERTa-Toxicity、HateBERT、HateXplain、ToxDect和ToxiGen)进行训练集数据增强的影响。一项实证研究证实了我们先前的发现,表明该方法可改善仇恨言论的泛化能力,在不同数据分布上提升召回率表现。此外,我们探索并比较了微调LLM与基于GPT-3.5模型的零样本仇恨检测的性能。我们的结果表明,尽管GPT-3.5模型实现了更好的泛化,但其在大多数数据集上召回率平平且精确率较低。诸如GPT-3.5及后续模型之类的敏感性是否可通过类似的文本生成技术得到提升,仍是一个开放问题。
引用
@article{arxiv.2311.09993,
title = {Generative AI for Hate Speech Detection: Evaluation and Findings},
author = {Sagi Pendzel and Tomer Wullach and Amir Adler and Einat Minkov},
journal= {arXiv preprint arXiv:2311.09993},
year = {2023}
}