中文

基于英语和德语的网络暴力检测:跨平台社交媒体数据

计算与语言 2024-10-10 v1 人工智能 社会与信息网络

摘要

网络暴力已成为一种普遍现象,在危机、选举和社会动荡期间加剧。已developed 多种方法来检测网络暴力使用人工智能,但尚未实现通用模型。网络暴力检测作为文本分类的挑战是获取高质量训练数据的成本。本研究聚焦于检测双语网络暴力 YouTube 评论,并衡量使用来自其他平台的额外数据对分类模型性能的影响。我们检查了来自跨平台的额外训练数据集对分类模型性能提升的价值。我们还包括诸如内容相似性、定义相似性和常见网络暴力词汇等因素,以衡量数据集对性能的影响。我们的发现表明,基于内容相似性、网络暴力词汇和定义的更多相似数据集会提高分类模型的性能。最佳性能通过结合 YouTube 评论、Twitter 和 Gab 的数据集获得,分别针对英语和德语 YouTube 评论的 F1 分数为 0.74 和 0.68。

关键词

引用

@article{arxiv.2410.05287,
  title  = {Hate Speech Detection Using Cross-Platform Social Media Data In English and German Language},
  author = {Gautam Kishore Shahi and Tim A. Majchrzak},
  journal= {arXiv preprint arXiv:2410.05287},
  year   = {2024}
}