评估用于在线极端主义研究的大型语言模型:识别、解释与新知识
计算与语言
2024-08-30 v1 人工智能
摘要
美国暴力极端主义的显著增加,促使需要自动化工具来检测和限制极端主义意识形态在网络上的传播。本研究评估了 Bidirectional Encoder Representations from Transformers (BERT) 和 Generative Pre-Trained Transformers (GPT) 在检测和分类国内网络极端主义帖子方面的性能。我们收集了包含“极右翼”和“极左翼”意识形态关键词的社交媒体帖子,并手动将其标记为极端主义或非极端主义。基于一个可操作的定义框架,极端主义帖子被进一步分类为极端主义的五个促成要素中的一个或多个。BERT 模型的性能根据训练数据规模和类别间的知识迁移进行了评估。我们还使用不同的提示比较了 GPT 3.5 和 GPT 4 模型的性能:朴素提示、外行定义提示、角色扮演提示和专业定义提示。结果表明,表现最好的 GPT 模型优于表现最好的 BERT 模型,通常更详细的提示会产生更好的结果。然而,过于复杂的提示可能会损害性能。不同版本的 GPT 对其认为属于极端主义的内容具有独特的敏感性。GPT 3.5 在分类极左翼极端主义帖子方面表现更好,而 GPT 4 在分类极右翼极端主义帖子方面表现更好。以 GPT 模型为代表的大型语言模型在在线极端主义分类任务中具有巨大潜力,在零样本设置下超越了传统的 BERT 模型。未来的研究应探索人机交互在优化 GPT 模型用于极端主义检测和分类任务中的作用,以开发更高效(例如,更快、更省力)和更有效(例如,更少错误或失误)的极端主义内容识别方法。
引用
@article{arxiv.2408.16749,
title = {Assessing Large Language Models for Online Extremism Research: Identification, Explanation, and New Knowledge},
author = {Beidi Dong and Jin R. Lee and Ziwei Zhu and Balassubramanian Srinivasan},
journal= {arXiv preprint arXiv:2408.16749},
year = {2024}
}