探测大语言模型在仇恨言论检测中的优势与脆弱性
计算与语言
2023-10-31 v2 计算机与社会
摘要
近期,社交媒体平台与研究人员均尝试利用大语言模型检测仇恨性或毒性语言。然而,这些工作均未旨在检测过程中使用解释、额外上下文以及受害群体信息。我们采用不同的提示变体、输入信息,并在零样本设定(不添加任何上下文示例)下评估大语言模型。我们选取了三个大语言模型(GPT-3.5、text-davinci 和 Flan-T5)以及三个数据集——HateXplain、implicit hate 和 ToxicSpans。我们发现,平均而言,在流程中纳入目标群体信息可使模型性能较基线在各数据集上大幅提升(约 20–30%)。在流程中加入理由/解释也对各数据集上的基线产生可观影响(约 10–20%)。此外,我们进一步给出了这些大语言模型在以下两方面失败的错误案例类型:(i) 分类;(ii) 解释其决策原因。此类脆弱点自动构成了这些模型的“越狱”提示,需开发工业级防护技术以使模型对这些提示具备鲁棒性。
引用
@article{arxiv.2310.12860,
title = {Probing LLMs for hate speech detection: strengths and vulnerabilities},
author = {Sarthak Roy and Ashish Harshavardhan and Animesh Mukherjee and Punyajoy Saha},
journal= {arXiv preprint arXiv:2310.12860},
year = {2023}
}
备注
13 pages, 9 figures, 7 tables, accepted to findings of EMNLP 2023