中文

社交媒体文本中网络欺凌的自动检测

计算与语言 2020-03-03 v1 计算机与社会 社会与信息网络

摘要

尽管社交媒体提供了极大的交流机会,但它们也增加了年轻人面临在线威胁情境的脆弱性。近期研究报道,网络欺凌在青少年中构成一个日益增长的问题。成功的预防依赖于对潜在有害信息的充分检测,而网络上的信息过载要求智能系统自动识别潜在风险。本文聚焦于通过对网络欺凌中的欺凌者、受害者和旁观者所写帖子进行建模,实现社交媒体文本中网络欺凌的自动检测。我们描述了英语和荷兰语训练语料的收集与细粒度标注,并进行了一系列二分类实验以确定网络欺凌自动检测的可行性。我们利用线性支持向量机并采用丰富的特征集,探究了哪些信息源对该特定任务贡献最大。在保留测试集上的实验显示出对网络欺凌相关帖子检测的良好结果。在超参数优化后,分类器对英语和荷兰语分别取得了 64% 和 61% 的 F1 值,且显著优于基于关键词和词一元文法的基线系统。

关键词

引用

@article{arxiv.1801.05617,
  title  = {Automatic Detection of Cyberbullying in Social Media Text},
  author = {Cynthia Van Hee and Gilles Jacobs and Chris Emmery and Bart Desmet and Els Lefever and Ben Verhoeven and Guy De Pauw and Walter Daelemans and Véronique Hoste},
  journal= {arXiv preprint arXiv:1801.05617},
  year   = {2020}
}

备注

21 pages, 9 tables, under review