XD 在 SemEval-2020 任务 12:使用 Transformer 编码器的社交媒体攻击性语言识别集成方法
计算与语言
2020-07-22 v1
摘要
本文提出了六个文档分类模型,使用最新的 transformer 编码器,以及一个高性能集成模型,用于社交媒体的攻击性语言识别任务。对于单个模型,应用深层 transformer 层来执行多头注意力。对于集成模型,取自这些单个模型的语句表示被拼接并输入线性解码器以做出最终决策。我们的集成模型优于单个模型,在开发集上相比单个模型最高有 8.6% 的提升。在测试集上,其宏平均 F1 达到 90.9%,并成为该共享任务子任务 A 中 85 个参与者里性能最高的系统之一。我们的分析表明,尽管集成模型在开发集上显著提高了准确率,但在测试集上的提升并不明显。
引用
@article{arxiv.2007.10945,
title = {XD at SemEval-2020 Task 12: Ensemble Approach to Offensive Language Identification in Social Media Using Transformer Encoders},
author = {Xiangjue Dong and Jinho D. Choi},
journal= {arXiv preprint arXiv:2007.10945},
year = {2020}
}
备注
To be published in SemEval-2020