中文

LIIR在SemEval-2020任务12上的跨语言增强多语冒犯性语言识别方法

计算与语言 2020-07-20 v2

摘要

本文介绍我们名为`LIIR'的系统,用于SemEval-2020任务12:社交媒体多语冒犯性语言识别(OffensEval 2)。我们参与了英语、丹麦语、希腊语、阿拉伯语和土耳其语的子任务A。我们分别适配并微调Google AI提供的BERT与Multilingual BERT模型,用于英语与非英语语言。对于英语,我们使用两个微调BERT模型的组合。对于其他语言,我们提出一种跨语言增强方法以丰富训练数据,并使用Multilingual BERT获取句子表示。LIIR在希腊语、土耳其语、英语、阿拉伯语和丹麦语中分别取得排名14/38、18/47、24/86、24/54和25/40。

关键词

引用

@article{arxiv.2005.03695,
  title  = {LIIR at SemEval-2020 Task 12: A Cross-Lingual Augmentation Approach for Multilingual Offensive Language Identification},
  author = {Erfan Ghadery and Marie-Francine Moens},
  journal= {arXiv preprint arXiv:2005.03695},
  year   = {2020}
}