中文

KUISAIL 参加 SemEval-2020 Task 12:用于社交媒体冒犯性言论识别的 BERT-CNN

计算与语言 2020-07-28 v1

摘要

在本文中,我们描述了将预训练 BERT 模型与卷积神经网络相结合的方法,用于 SemEval 2020 的多语言冒犯性语言识别共享任务(OffensEval 2020)的子任务 A。我们表明,将 CNN 与 BERT 结合使用优于单独使用 BERT,并强调了将预训练语言模型用于下游任务的重要性。我们的系统在阿拉伯语中以 0.897 的宏平均 F1 分数排名第 4,在希腊语中以 0.843 的分数排名第 4,在土耳其语中以 0.814 的分数排名第 3。此外,我们提出了 ArabicBERT,这是一组面向阿拉伯语的预训练 Transformer 语言模型,我们将其与社区共享。

关键词

引用

@article{arxiv.2007.13184,
  title  = {KUISAIL at SemEval-2020 Task 12: BERT-CNN for Offensive Speech Identification in Social Media},
  author = {Ali Safaya and Moutasem Abdullatif and Deniz Yuret},
  journal= {arXiv preprint arXiv:2007.13184},
  year   = {2020}
}

备注

to be published in the proceedings of the 14th International Workshop on Semantic Evaluation (SemEval2020), Association for Computational Linguistics (ACL)