中文

多语言情境下的人机协同仇恨言论分类

计算与语言 2023-01-03 v2 机器学习

摘要

公共辩论向数字空间的转移伴随着网络仇恨言论的上升。尽管已提出许多有前景的仇恨言论分类方法,研究通常仅聚焦于单一语言(通常为英语),且未解决三个关键问题:部署后性能、分类器维护与基础设施限制。本文中,我们引入一种新的人机协同(human-in-the-loop)基于 BERT 的仇恨言论分类流程,并追踪其从初始数据收集与标注直至部署后的整个开发过程。我们的分类器使用来自包含超过 422k 样例的原创语料库的数据训练,专为瑞士固有的多语言环境开发,并以 80.5 的 F1 分数在德语上超越当前性能最佳的基于 BERT 的多语言分类器 5.8 个 F1 点,在法语上超越 3.6 个 F1 点。我们在 12 个月期间的系统评估进一步凸显了持续的人机协同分类器维护对于确保部署后鲁棒仇恨言论分类的至关重要性。

关键词

引用

@article{arxiv.2212.02108,
  title  = {Human-in-the-Loop Hate Speech Classification in a Multilingual Context},
  author = {Ana Kotarcic and Dominik Hangartner and Fabrizio Gilardi and Selina Kurer and Karsten Donnay},
  journal= {arXiv preprint arXiv:2212.02108},
  year   = {2023}
}

备注

Findings of EMNLP 2022