中文

用于检测攻击性语言的跨语言归纳迁移

计算与语言 2020-07-09 v1 信息检索

摘要

随着社交媒体的日益使用及其可获取性,人们观察到多种语言和领域中出现了大量使用攻击性语言的实例。这一现象引发了跨语言检测社交媒体中攻击性语言的日益增长的需求。在OffensEval 2020中,组织者发布了包含五种不同语言推文的\textit{多语言攻击性语言识别数据集}(mOLID)以检测攻击性语言。在这项工作中,我们引入一种跨语言归纳方法,利用上下文词嵌入\textit{XLM-RoBERTa}(XLM-R)识别推文中的攻击性语言。我们表明我们的模型在所有五种语言上均具竞争力,在英语任务中以F1-score 0.9190.919 获得第四名,在土耳其语任务中以F1-score 0.7810.781 获得第八名。进一步的实验证明我们的模型在零样本学习环境下同样具竞争力,并可扩展至其他语言。

关键词

引用

@article{arxiv.2007.03771,
  title  = {Cross-lingual Inductive Transfer to Detect Offensive Language},
  author = {Kartikey Pant and Tanvi Dadu},
  journal= {arXiv preprint arXiv:2007.03771},
  year   = {2020}
}

备注

Accepted at OffenseEval 2020 to be held at COLING 2020