QutNocturnal@HASOC'19:用于印地语仇恨言论与攻击性内容识别的 CNN
计算与语言
2020-08-31 v1 机器学习
社会与信息网络
摘要
我们描述了在 FIRE 2019 组织的 HASOC 竞赛中针对印地语任务 1 的冠军团队方案。该任务旨在识别印地语中的仇恨言论与攻击性语言。更具体地,这是一个二分类问题,系统需将推文分为两类:(a) \emph{仇恨与攻击性(HOF)} 与 (b) \emph{非仇恨或攻击性(NOT)}。与利用维基百科等通用领域大型语料预训练词向量(即词嵌入)的流行思路不同,我们使用相对较小的相关推文集合(即印地语与 Hinglish 中的随机与讽刺推文)进行预训练。我们在预训练词向量之上训练了一个卷积神经网络(CNN)。该方法使我们在所有团队中排名该任务第一。我们的方法可轻易适配其他目标为在有限上下文下预测文本类别的应用。
引用
@article{arxiv.2008.12448,
title = {QutNocturnal@HASOC'19: CNN for Hate Speech and Offensive Content Identification in Hindi Language},
author = {Md Abul Bashar and Richi Nayak},
journal= {arXiv preprint arXiv:2008.12448},
year = {2020}
}