中文

Clubhouse 中的仇恨言论检测

机器学习 2021-07-13 v3

摘要

随着语音聊天室的兴起,大量数据资源得以向研究界开放,可用于自然语言处理任务。语音聊天室中的管理员会主动监控讨论并移除使用攻击性语言的参与者。然而,由于部分参与者试图以创造性的方式表达仇恨言论,这使得仇恨言论检测变得更加困难。这导致在 Clubhouse 等新媒体中仇恨言论检测颇具挑战性。据我们所知,所有仇恨言论数据集均采集自 Twitter 等文本资源。在本文中,我们迈出了第一步,从社交媒体行业的新星 Clubhouse 中收集了一个重要的数据集。我们利用 Google Perspective Scores 从统计角度对收集到的实例进行分析。我们的实验表明,作为高层文本特征,Perspective Scores 的表现优于 Bag of Words 和 Word2Vec。

关键词

引用

@article{arxiv.2106.13238,
  title  = {Hate Speech Detection in Clubhouse},
  author = {Hadi Mansourifar and Dana Alsagheer and Reza Fathi and Weidong Shi and Lan Ni and Yan Huang},
  journal= {arXiv preprint arXiv:2106.13238},
  year   = {2021}
}