中文

利用基于知识的泛化方法去除仇恨言论检测任务中的刻板偏见

计算与语言 2020-01-17 v1 人工智能 机器学习

摘要

随着社交媒体平台上仇恨传播事件的不断增加,设计滥用检测机制以主动避免和控制此类事件至关重要。尽管存在仇恨言论检测方法,但它们对词语产生刻板印象,因此受到固有偏见的训练影响。偏见去除传统上针对结构化数据集研究,但我们旨在从非结构化文本数据中缓解偏见。本文做出两项重要贡献。首先,我们系统性地设计量化任意模型偏见的方法,并提出识别模型所刻板化词语集合的算法。其次,我们提出利用基于知识的泛化实现无偏见学习的新方法。基于知识的泛化提供了一种编码知识的有效途径,因为其提供的抽象不仅泛化内容,还便于从仇恨言论检测分类器中撤回信息,从而减少不平衡。我们尝试多种知识泛化策略并分析其对总体性能及偏见缓解的影响。我们在两个真实数据集上的实验——规模约 96k 的 Wikipedia Talk Pages 数据集(WikiDetox)和规模约 24k 的 Twitter 数据集——表明,使用基于知识的泛化通过迫使分类器从泛化内容中学习而带来更好性能。我们的方法利用现有知识库,并可轻易扩展至其他任务。

关键词

引用

@article{arxiv.2001.05495,
  title  = {Stereotypical Bias Removal for Hate Speech Detection Task using Knowledge-based Generalizations},
  author = {Pinkesh Badjatiya and Manish Gupta and Vasudeva Varma},
  journal= {arXiv preprint arXiv:2001.05495},
  year   = {2020}
}