UHH-LT 在 SemEval-2020 任务 12 中的工作:面向攻击性语言检测的预训练 Transformer 网络微调
计算与语言
2020-06-12 v2
摘要
对 BERT 等预训练 transformer 网络进行微调可为文本分类任务带来最先进的结果。通常,微调是在特定任务的训练数据集上以监督方式进行的。也可以通过进一步预训练掩码语言建模(MLM)任务,以无监督方式事先进行微调。在此过程中,类似于实际分类目标数据集的无监督 MLM 领域内数据可实现模型的领域自适应。在本文中,我们比较了当前预训练 transformer 网络在有和无 MLM 微调情况下用于攻击性语言检测的性能。我们经过 MLM 微调的基于 RoBERTa 的分类器在英语语言的 SemEval 2020 共享任务 12 中官方排名第一。使用 ALBERT 模型的进一步实验甚至超越了这一结果。
引用
@article{arxiv.2004.11493,
title = {UHH-LT at SemEval-2020 Task 12: Fine-Tuning of Pre-Trained Transformer Networks for Offensive Language Detection},
author = {Gregor Wiedemann and Seid Muhie Yimam and Chris Biemann},
journal= {arXiv preprint arXiv:2004.11493},
year = {2020}
}