基于多语言领域特定词嵌入的跨语言仇恨言论检测
计算与语言
2021-05-03 v1 人工智能
摘要
在线社交网络中的自动仇恨言论检测是自然语言处理(NLP)中的一个重要开放问题。仇恨言论是一个多维问题,强烈依赖于语言和文化因素。尽管其相关性强,该主题的研究几乎 exclusively 致力于英语。大多数监督学习资源,如标注数据集和NLP工具,都是为同一种语言创建的。考虑到全球大部分用户使用非英语语言,亟需创建高效的多语言仇恨言论检测方法。在本文中,我们提议从迁移学习的视角解决多语言仇恨言论检测问题。我们的目标是确定一种特定语言的知识是否可用于分类其他语言,并确定实现此目标的有效途径。我们提出一种仇恨特定的数据表示,并针对大多数(与我们的模型不同)在海量数据上训练的通用途通用表示评估其有效性。我们聚焦于跨语言设定,其中需要在无该语言任何标注数据的情况下分类仇恨言论。我们表明,使用我们简单却特定的多语言仇恨表示可改善分类结果。我们通过定性分析解释这一点,显示我们的特定表示能够捕捉不同语言中仇恨言论呈现的一些共同模式。据我们所知,我们的提议是构建多语言特定任务表示的首次尝试。尽管简单,我们的模型在大多数实验设置下优于先前方法。我们的发现可引导未来解决方案朝向使用领域特定表示。
引用
@article{arxiv.2104.14728,
title = {Cross-lingual hate speech detection based on multilingual domain-specific word embeddings},
author = {Aymé Arango and Jorge Pérez and Barbara Poblete},
journal= {arXiv preprint arXiv:2104.14728},
year = {2021}
}