GUIR 在 SemEval-2020 任务 12 中的工作:面向攻击性语言检测的域调优上下文模型
计算与语言
2020-07-30 v1
摘要
攻击性语言检测是自然语言处理中一项重要且具有挑战性的任务。我们介绍了提交给 OffensEval 2020 共享任务的工作,该任务包含三个英文子任务:识别攻击性语言的存在(子任务 A)、识别攻击性语言中是否存在目标(子任务 B),以及识别目标的类别(子任务 C)。我们的实验探索了使用域调优的上下文语言模型(即 BERT)来完成该任务。我们还针对特定子任务,在 BERT 模型之上试验了不同的组件与配置(例如多视图 SVM)。我们的提交在子任务 A 中取得了 91.7% 的 F1 分数,在子任务 B 中为 66.5%,在子任务 C 中为 63.2%。我们进行了消融研究,结果表明域调优显著提升了分类性能。此外,错误分析揭示了我们模型常见的误分类错误,并勾勒出未来的研究方向。
引用
@article{arxiv.2007.14477,
title = {GUIR at SemEval-2020 Task 12: Domain-Tuned Contextualized Models for Offensive Language Detection},
author = {Sajad Sotudeh and Tong Xiang and Hao-Ren Yao and Sean MacAvaney and Eugene Yang and Nazli Goharian and Ophir Frieder},
journal= {arXiv preprint arXiv:2007.14477},
year = {2020}
}
备注
SemEval 2020