中文

Galileo 在 SemEval-2020 任务 12 中的表现:基于预训练语言模型的多语言攻击性语言识别学习

计算与语言 2020-10-08 v1

摘要

本文描述了 Galileo 在 SemEval-2020 任务 12 中检测和分类社交媒体攻击性语言的表现。对于攻击性语言识别,我们提出了一种使用预训练语言模型 ERNIE 和 XLM-R 的多语言方法。对于攻击性语言分类,我们提出了一种在多个监督模型生成的软标签上训练的知识蒸馏方法。我们的团队参与了全部三个子任务。在子任务 A——攻击性语言识别中,我们按所有语言的平均 F1 分数排名第一。我们也是唯一一支在所有语言中均排名前三的队伍。我们还在子任务 B——攻击类型自动分类和子任务 C——攻击目标识别中夺得第一。

关键词

引用

@article{arxiv.2010.03542,
  title  = {Galileo at SemEval-2020 Task 12: Multi-lingual Learning for Offensive Language Identification using Pre-trained Language Models},
  author = {Shuohuan Wang and Jiaxiang Liu and Xuan Ouyang and Yu Sun},
  journal= {arXiv preprint arXiv:2010.03542},
  year   = {2020}
}

备注

8 pages, 2 figures, 6 tables. Accepted at Proceedings of 14th International Workshop on Semantic Evaluation (SemEval-2020)