辱骂具有语境依赖性,NLP 呢?语境在辱骂性语言标注与检测中的作用
计算与语言
2021-03-30 v1
摘要
最广泛用于辱骂性语言检测的数据集包含由一名或多名标注者手动判定为辱骂或非辱骂的消息列表(通常为推文),标注在消息层面进行。在本文中,我们研究当消息的仇恨内容也基于语境进行判定时会发生什么,因为消息往往具有歧义,需要在其出现语境中加以解释。我们首先在有无语境两种条件下重新标注了一个广泛使用的英文辱骂性语言检测数据集的一部分。然后,我们比较了在这两类数据集上获得的三种分类算法的性能,认为语境感知分类更具挑战性,但也更接近于真实的应用场景。
引用
@article{arxiv.2103.14916,
title = {Abuse is Contextual, What about NLP? The Role of Context in Abusive Language Annotation and Detection},
author = {Stefano Menini and Alessio Palmero Aprosio and Sara Tonelli},
journal= {arXiv preprint arXiv:2103.14916},
year = {2021}
}