利用深度多任务学习融合多领域异构数据用于仇恨言论检测
计算与语言
2021-03-24 v1
摘要
随着社交媒体上用户生成网络内容的指数级增长,互联网不同板块中针对个人或群体的辱骂性语言也在迅速蔓延。人工审核员很难识别并过滤这些攻击性内容。深度神经网络在仇恨言论检测及相关应用中已展现出具有合理准确性的前景。然而,分类器严重依赖于训练数据的大小和质量。如此高质量的大规模数据集并不易获得。此外,近期出现的现有数据集并非遵循相同的标注指南创建,且往往关注与仇恨相关的不同类型及子类型。为解决这一数据稀疏问题并获取更具全局代表性的特征,我们提出了一种基于卷积神经网络(CNN)的多任务学习模型(MTLs)\footnote{代码见 https://github.com/imprasshant/STL-MTL}以利用多源信息。在三个基准数据集上的实证分析显示了所提方法的有效性,其准确率和 F 值显著提升,相对于现有系统取得了最先进的性能。
引用
@article{arxiv.2103.12412,
title = {Leveraging Multi-domain, Heterogeneous Data using Deep Multitask Learning for Hate Speech Detection},
author = {Prashant Kapil and Asif Ekbal},
journal= {arXiv preprint arXiv:2103.12412},
year = {2021}
}
备注
10 pages, 2 figures, 13 tables. Accepted at THE SEVENTEENTH INTERNATIONAL CONFERENCE ON NATURAL LANGUAGE PROCESSING (ICON) 2020