中文

UPB 在 SemEval-2021 任务5中的工作:面向毒性片段检测的虚拟对抗训练

计算与语言 2021-04-20 v1

摘要

网络空间中两极分化与毒性的现实影响以负面方式标记了2020年末与今年年初。Semeval-2021 任务5——毒性片段检测基于 Jigsaw Unintended Bias 数据集子集的新颖标注,是首个致力于识别毒性层级片段的语言毒性检测任务。在该任务中,参与者须自动检测短评论中使信息具有毒性的字符片段。我们的模型考虑在若干基于 Transformer 的模型(即 BERT 与 RoBERTa)微调过程中,结合条件随机场(Conditional Random Fields),于半监督设定下应用虚拟对抗训练(Virtual Adversarial Training)。我们的方法带来性能提升与更鲁棒的模型,使我们在官方提交中达到 65.73% 的 F1 分数,并在评测后进一步调优达到 66.13% 的 F1 分数。

关键词

引用

@article{arxiv.2104.08635,
  title  = {UPB at SemEval-2021 Task 5: Virtual Adversarial Training for Toxic Spans Detection},
  author = {Andrei Paraschiv and Dumitru-Clementin Cercel and Mihai Dascalu},
  journal= {arXiv preprint arXiv:2104.08635},
  year   = {2021}
}