面向多语言仇恨语音检测的深度学习模型
社会与信息网络
2020-12-10 v3 计算与语言
摘要
仇恨语音检测是一个具有挑战性的问题,现有大多数数据集仅有一种语言:英语。在本文中,我们对来自16个不同来源的9种语言的多语言仇恨语音进行了大规模分析。我们观察到,在低资源设定下,诸如LASER嵌入加逻辑回归的简单模型表现最佳,而在高资源设定下基于BERT的模型表现更好。在零样本分类情况下,意大利语和葡萄牙语等语言取得了良好结果。我们提出的框架可用作低资源语言的高效解决方案。这些模型也可作为未来多语言仇恨语音检测任务的良好基线。我们已在 https://github.com/punyajoy/DE-LIMIT 公开了我们的代码和实验设置以供其他研究者使用。
引用
@article{arxiv.2004.06465,
title = {Deep Learning Models for Multilingual Hate Speech Detection},
author = {Sai Saketh Aluru and Binny Mathew and Punyajoy Saha and Animesh Mukherjee},
journal= {arXiv preprint arXiv:2004.06465},
year = {2020}
}
备注
16 pages, Accepted at ECML-PKDD 2020