中文

Lone Pine 在 SemEval-2021 任务 5 中的方法:使用 BERToxic 的细粒度仇恨语音检测

计算与语言 2021-07-29 v1 机器学习

摘要

本文描述了我们解决有毒片段检测问题(SemEval-2021 任务 5)的方法。我们提出 BERToxic,一个微调预训练 BERT 模型以在给定文本中定位有毒文本片段并利用额外后处理步骤精炼边界的系统。后处理步骤包括(1)将连续有毒标记之间的字符偏移标记为有毒,以及(2)将至少有一个标记被标记为有毒的单词赋予有毒标签。通过实验,我们表明这两个后处理步骤在测试集上将模型性能提升了 4.16%。我们还研究了数据增强与集成建模策略对我们系统的影响。我们的系统显著优于提供的基线,并取得了 0.683 的 F1 分数,在竞赛中使 Lone Pine 位列 91 支队伍中的第 17 名。我们的代码发布于 https://github.com/Yakoob-Khan/Toxic-Spans-Detection

关键词

引用

@article{arxiv.2104.03506,
  title  = {Lone Pine at SemEval-2021 Task 5: Fine-Grained Detection of Hate Speech Using BERToxic},
  author = {Yakoob Khan and Weicheng Ma and Soroush Vosoughi},
  journal= {arXiv preprint arXiv:2104.03506},
  year   = {2021}
}

备注

7 pages, 3 figures. Accepted at SemEval-2021 Workshop, ACL-IJCNLP 2021