中文

AI-UPV 在 IberLEF-2021 DETOXIS 任务中的工作:使用 Transformers 与统计模型检测移民相关网络新闻评论中的毒性

计算与语言 2021-11-09 v1 计算机与社会 机器学习

摘要

本文描述了我们参与 2021 年第三届伊比利亚语言评估论坛(IberLEF)DETOXIS(西班牙语评论毒性检测)共享任务的情况。该共享任务分为两个相关的分类任务:(i) 任务 1:毒性检测;(ii) 任务 2:毒性等级检测。它们关注由不同移民相关在线新闻文章中发布的有毒评论传播所加剧的仇外问题。缓解该问题的必要努力之一是检测评论中的毒性。我们的主要目标是基于竞赛的官方指标——任务 1 的 F1-score 与任务 2 的接近度评估指标(CEM)——在 DETOXIS 共享任务 2021 中实现一个准确模型以检测网络新闻文章评论中的仇外内容。为解决这些任务,我们使用了两类机器学习模型:(i) 统计模型与 (ii) 用于语言理解的深度双向 Transformers(BERT)模型。我们在两项任务中使用 BETO(一个在大型西班牙语语料上训练的 BERT 模型)取得了最佳结果。我们在任务 1 官方排名中以 0.5996 的 F1-score 获得第 3 名,并以 0.7142 的 CEM 在任务 2 官方排名中取得第 6 名。我们的结果表明:(i) BERT 模型在文本评论毒性检测中优于统计模型;(ii) 单语 BERT 模型在其预训练语言下的文本评论毒性检测中较之多语 BERT 模型具有优势。

关键词

引用

@article{arxiv.2111.04530,
  title  = {AI-UPV at IberLEF-2021 DETOXIS task: Toxicity Detection in Immigration-Related Web News Comments Using Transformers and Statistical Models},
  author = {Angel Felipe Magnossão de Paula and Ipek Baris Schlicht},
  journal= {arXiv preprint arXiv:2111.04530},
  year   = {2021}
}

备注

20 pages. Presented at IberLEF. See http://ceur-ws.org/Vol-2943/detoxis_paper2.pdf