PUM 在 SemEval-2020 任务 12 中的方案:聚合基于 Transformer 的模型特征用于攻击性语言识别
计算与语言
2020-10-06 v1
摘要
在本文中,我们描述了 PUM 团队在 SemEval-2020 任务 12 中的参赛方案。构建我们的解决方案涉及利用自然语言处理中两个著名的预训练模型:BERT 和 XLNet,它们在多项 NLP 任务中取得了 SOTA 结果。这些模型针对每个子任务分别进行了微调,从其隐藏层提取的特征被组合并输入到一个全连接神经网络中。该使用聚合 Transformer 特征的模型可作为攻击性语言识别问题的一个有力工具。我们的团队在子任务 C(攻击目标识别)中以 64.727% 的宏 F1 分数在 40 支队伍中排名第 7,在子任务 A(攻击性语言识别)中以 89.726% 的 F1 分数在 85 支队伍中排名第 64。
引用
@article{arxiv.2010.01897,
title = {PUM at SemEval-2020 Task 12: Aggregation of Transformer-based models' features for offensive language recognition},
author = {Piotr Janiszewski and Mateusz Skiba and Urszula Walińska},
journal= {arXiv preprint arXiv:2010.01897},
year = {2020}
}
备注
7 pages, 0 figures. Proceedings of the International Workshop on Semantic Evaluation (SemEval-2020)