中文

“不止于仇恨”:检测线上有害言论的多维视角

计算与语言 2022-10-31 v1

摘要

良好标注的数据是优秀自然语言处理(NLP)模型的先决条件。但标注决策常受时间或标注者一致性最优化的支配。我们主张在跨学科环境中对攻击性线上言论标注采取细致努力。检测攻击性内容正迅速成为最重要的现实世界NLP任务之一。然而,多数数据集使用单一二值标签(如仇恨或不文明),尽管每个概念具多面性。该建模选择严重限制细致洞察与模型表现。我们表明,对不文明及仇恨或不容忍内容采用更细粒度多标签方法可同时解决概念与性能问题。我们发布了一个关于美英移民的新数据集,含逾40,000条推文,标注了不文明与不容忍不同方面的六个标签。该数据集不仅支持对线上有害言论更细致理解,其上训练的模型在基准数据集上也优于或匹敌现有表现。

关键词

引用

@article{arxiv.2210.15870,
  title  = {"It's Not Just Hate'': A Multi-Dimensional Perspective on Detecting Harmful Speech Online},
  author = {Federico Bianchi and Stefanie Anja Hills and Patricia Rossini and Dirk Hovy and Rebekah Tromble and Nava Tintarev},
  journal= {arXiv preprint arXiv:2210.15870},
  year   = {2022}
}

备注

EMNLP 2022