解码恐怖主义话语:使用大语言模型识别刻板印象与准偏性仇恨言论
机器学习
2026-05-12 v3
摘要
近年来,伊斯兰仇恨情绪在西方社会中获得显著势头,由数字通信网络的兴起所推动。本文对针对4Chan、Gab、Telegram等极端社交平台上流传的专门性准偏性伊斯兰仇恨术语(如muzrat、pislam、mudslime、mohammedan、muzzies)进行大规模分析。许多术语在特定语境之外显得词义中性或模糊,难以被人工或自动系统可靠识别为仇恨言论。首先,我们使用大语言模型(LLMs)展示其理解这些术语的能力。其次,Google Perspective API表明伊斯兰仇恨帖子通常比其他仇恨类别(如反犹主义)获得更高的毒性评分。最后,我们采用BERT主题建模方法提取不同主题及伊斯兰仇恨话语。我们的发现表明,LLMs能够理解这些词汇稀缺(out-of-vocabulary)的侮辱性术语;然而,针对此类话语的 moderation 策略和算法检测仍需进一步改进。我们的主题建模还表明,伊斯兰仇恨文本存在于各种政治、阴谋论及极右翼运动中,尤其针对穆斯林移民。综上所述,我们进行了伊斯兰准偏性术语的首次大规模研究,为全球范围内的伊斯兰仇恨问题提供了重要视角。
引用
@article{arxiv.2503.18273,
title = {Decoding Islamophobic Discourse: Using LLMs to Identify Tropes and Semi-Coded Hate Speech},
author = {Raza Ul Mustafa and Roi Dupart and Gabrielle Smith and Noman Ashraf and Nathalie Japkowicz},
journal= {arXiv preprint arXiv:2503.18273},
year = {2026}
}