引入面向 Telegram 的辱骂性语言分类框架以调查德国仇恨者社群
计算与语言
2021-11-25 v2
摘要
由于传统社交媒体平台持续封禁传播仇恨言论或其他形式辱骂性语言的用户(这一过程称为去平台化),这些用户迁移到不对用户内容进行审核的替代平台。对于德国仇恨者社群而言,一个相关且受欢迎的平台是 Telegram,迄今为止针对该平台的研究努力十分有限。本研究旨在开发一个广泛的框架,包含(i)用于德语 Telegram 消息的辱骂性语言分类模型,以及(ii)用于 Telegram 频道仇恨程度的分类模型。对于第一部分,我们使用包含来自其他平台帖子的现有辱骂性语言数据集来开发分类模型。对于频道分类模型,我们开发了一种方法,将来自主题模型的频道特定内容信息与社会图相结合,以预测频道的仇恨程度。此外,我们以关于德国 Telegram 上仇恨者社群演变的深入结果补充了这两种仇恨言论检测方法。我们还向仇恨言论研究界提出了用于社交媒体平台的可扩展网络分析方法。作为本研究的额外产出,我们提供了一个包含 1,149 条标注 Telegram 消息的标注辱骂性语言数据集。
引用
@article{arxiv.2109.07346,
title = {Introducing an Abusive Language Classification Framework for Telegram to Investigate the German Hater Community},
author = {Maximilian Wich and Adrian Gorniak and Tobias Eder and Daniel Bartmann and Burak Enes Çakici and Georg Groh},
journal= {arXiv preprint arXiv:2109.07346},
year = {2021}
}