利用用户内与用户间表示学习实现自动化仇恨言论检测
计算与语言
2018-09-17 v2 人工智能
摘要
仇恨言论检测是自然语言处理(NLP)中一个关键但具有挑战性的问题。尽管已有大量研究致力于开发 NLP 仇恨言论检测方法,其准确率仍然较低。核心问题在于社交媒体帖子简短且含噪,而大多数现有仇恨言论检测方案将每条帖子视为孤立的输入实例,这很可能产生较高的假阳性与假阴性率。本文中,我们提出一种新颖模型,利用用户内与用户间表示学习在 Twitter 上进行鲁棒的仇恨言论检测,从而从根本上改进了自动化仇恨言论检测。除目标推文外,我们收集并分析该用户的历史帖子以建模用户内推文表示。为抑制单条推文中的噪声,我们还通过增强的用户间表示学习技术对所有其他用户发布的相似推文进行建模。实验上,我们表明利用这两种表示可将一个强双向 LSTM 基线模型的 f-score 显著提升 10.1%。
引用
@article{arxiv.1804.03124,
title = {Leveraging Intra-User and Inter-User Representation Learning for Automated Hate Speech Detection},
author = {Jing Qian and Mai ElSherief and Elizabeth M. Belding and William Yang Wang},
journal= {arXiv preprint arXiv:1804.03124},
year = {2018}
}