IYKYK:利用语言模型解码极端主义密码词
计算与语言
2025-06-09 v1
摘要
极端组织发展出复杂的内部语言,亦称密码词(cryptolects),以排除或误导外部人员。我们研究当前语言技术检测和解读两种在线极端主义平台密码词的能力。评估八个模型 across六个任务,我们的结果表明,通用型大语言模型无法一致检测或解码极端主义语言。然而,通过领域适应和专用提示技术可显著提升性能。这些结果为制定和部署自动化 moderation 技术提供了重要见解。我们进一步开发并发布了 novel 标记和未标记数据集,包括 1940 万条来自极端主义平台的帖子以及经人类专家验证的词汇表。
关键词
引用
@article{arxiv.2506.05635,
title = {IYKYK: Using language models to decode extremist cryptolects},
author = {Christine de Kock and Arij Riabi and Zeerak Talat and Michael Sejr Schlichtkrull and Pranava Madhyastha and Ed Hovy},
journal= {arXiv preprint arXiv:2506.05635},
year = {2025}
}