UniParma 在 SemEval-2021 任务 5 中的工作:基于 CharacterBERT 与词袋模型的有毒文本跨度检测
计算与语言
2021-04-12 v2
摘要
随着数字信息的日益普及,有毒内容也在不断增加。因此,此类语言的检测至关重要。我们利用最先进的预训练语言模型(CharacterBERT)与传统词袋技术相结合来解决该问题。由于内容中充斥着未按照词典拼写书写的有毒词汇,关注单个字符至关重要。因此,我们使用 CharacterBERT 基于词字符提取特征。它由一个 CharacterCNN 模块组成,该模块从上下文中学习字符嵌入。随后,这些嵌入被输入到著名的 BERT 架构中。另一方面,词袋方法通过确保一些常用有毒词汇被相应标注,进一步改进了上述结果。我们的系统与第一名的差距为 4%,在竞赛中排名第 36 位。代码已公开,以便进一步研究和复现结果。
引用
@article{arxiv.2103.09645,
title = {UniParma at SemEval-2021 Task 5: Toxic Spans Detection Using CharacterBERT and Bag-of-Words Model},
author = {Akbar Karimi and Leonardo Rossi and Andrea Prati},
journal= {arXiv preprint arXiv:2103.09645},
year = {2021}
}