面向低资源语言的多语言攻击性语言识别
计算与语言
2021-05-21 v3 人工智能
机器学习
社会与信息网络
摘要
攻击性内容在社交媒体中普遍存在,是企业与政府组织关切的问题。近期若干研究探讨检测此类内容各种形式(如仇恨言论、网络欺凌和网络攻击)的方法。这些研究绝大多数处理英语,部分因为大多数可用标注数据集含英语数据。本文中,我们利用可用英语数据集,通过跨语言上下文词嵌入与迁移学习对低资源语言进行预测。我们将预测投射到阿拉伯语、孟加拉语、丹麦语、希腊语、印地语、西班牙语和土耳其语的可比数据上。我们报告了 TRAC-2 共享任务中孟加拉语 F1 macro 0.8415、OffensEval 2020 中丹麦语 F1 macro 0.8532 与希腊语 F1 macro 0.8701、HASOC 2019 共享任务中印地语 F1 macro 0.8568,以及 SemEval-2019 Task 5 (HatEval) 中西班牙语 F1 macro 0.7513 的结果,表明我们的方法优于近期这些语言共享任务中提交的最佳系统。此外,我们利用 OffensEval 2020 共享任务的训练与开发集,报告了阿拉伯语和土耳其语上具有竞争力的表现。所有语言的结果证实了跨语言上下文嵌入与迁移学习在该任务上的鲁棒性。
引用
@article{arxiv.2105.05996,
title = {Multilingual Offensive Language Identification for Low-resource Languages},
author = {Tharindu Ranasinghe and Marcos Zampieri},
journal= {arXiv preprint arXiv:2105.05996},
year = {2021}
}
备注
Accepted to ACM Transactions on Asian and Low-Resource Language Information Processing (TALLIP). This is an extended version of a paper accepted to EMNLP. arXiv admin note: substantial text overlap with arXiv:2010.05324