利用大语言模型发现极端主义社交媒体中新兴的编码反犹仇恨言论
计算与语言
2024-01-25 v2 人工智能
信息检索
机器学习
摘要
在线仇恨言论的泛滥给社交媒体平台带来了严峻挑战。其中一个特定难题在于,某些群体使用编码语言,既旨在为其用户营造归属感,又试图规避检测。编码语言演变迅速,其用法随时间而变化。本文提出了一种检测新兴编码仇恨术语的方法论,并在在线反犹话语的语境下对该方法进行了测试。该方法针对极端主义用户常用的社交媒体平台上的帖子进行抓取,使用的种子表达式与先前已知的针对犹太人的仇恨话语相关。该方法首先识别最能代表每个帖子的表达式,并计算其在整个语料库中的频率;随后过滤掉语法不连贯的表达式以及先前已遇到的表达式,从而聚焦于新兴的、结构良好的术语。接着,利用微调后的大语言模型(LLM)评估这些表达式与已知反犹术语的语义相似度,并进一步过滤掉与已知仇恨表达相差过远的表达式。最后,剔除其中包含明显与犹太主题相关术语的新兴反犹表达,仅保留编码形式的仇恨表达。
引用
@article{arxiv.2401.10841,
title = {Using LLMs to discover emerging coded antisemitic hate-speech in extremist social media},
author = {Dhanush Kikkisetti and Raza Ul Mustafa and Wendy Melillo and Roberto Corizzo and Zois Boukouvalas and Jeff Gill and Nathalie Japkowicz},
journal= {arXiv preprint arXiv:2401.10841},
year = {2024}
}
备注
9 pages, 4 figures, 2 algorithms, 3 tables