NLRG 在 SemEval-2021 任务 5:利用基于 BERT 的令牌分类与跨度预测技术的毒性跨度检测
计算与语言
2021-08-16 v2 机器学习
摘要
文本毒性检测近年来已成为一个热门的 NLP 任务。在 SemEval-2021 任务 5 毒性跨度检测中,重点在于检测段落中的毒性跨度。大多数最先进的跨度检测方法采用多种技术,可宽泛地分为令牌分类或跨度预测方法。在本文中,我们探讨了这两类方法的简易版本及其在该任务上的表现。具体而言,我们对两种方法均使用基于 BERT 的模型——BERT、RoBERTa 和 SpanBERT。我们还组合这些方法并对其进行修改,以改进毒性跨度的预测。为此,我们研究了四种混合方法的结果——多跨度、跨度+令牌、LSTM-CRF,以及使用并集/交集的预测偏移组合。此外,我们进行了彻底的消融分析并分析了观察到的实验结果。我们的最佳提交——SpanBERT 跨度预测器与 RoBERTa 令牌分类器预测的组合——在测试集上取得了 0.6753 的 F1 分数。我们最佳评测后 F1 分数为 0.6895,来自前 3 个 RoBERTa 令牌分类检查点预测偏移的交集。这些方法的性能平均比共享基线模型——RNNSL 和 SpaCy NER——高出 3%。
引用
@article{arxiv.2102.12254,
title = {NLRG at SemEval-2021 Task 5: Toxic Spans Detection Leveraging BERT-based Token Classification and Span Prediction Techniques},
author = {Gunjan Chhablani and Abheesht Sharma and Harshit Pandey and Yash Bhartia and Shan Suthaharan},
journal= {arXiv preprint arXiv:2102.12254},
year = {2021}
}
备注
8 pages, 3 figures, SemEval-2021 Workshop, ACL-IJCNLP 2021