中文

减少俄语仇恨言论检测中非预期的身份偏见

计算与语言 2020-10-23 v1 人工智能

摘要

毒性内容已成为许多在线社区的严重问题,并且已在包括俄语在内的多种语言中不断增长。仇恨言论制造了恐吓、歧视的环境,甚至可能煽动一些现实世界的暴力。研究人员和社交平台一段时间以来一直专注于开发模型以检测在线交流中的毒性内容。这些模型的一个常见问题是对于一些并非毒性但因其缺陷而作为分类器触发词的词(例如 woman、black、jew)存在偏见。在本文中,我们描述了在俄语中分类仇恨言论的努力,并提出了减少非预期偏见的简单技术,例如使用语言模型以受保护身份相关的术语和词作为上下文生成训练数据,并对这些词应用词丢弃。

关键词

引用

@article{arxiv.2010.11666,
  title  = {Reducing Unintended Identity Bias in Russian Hate Speech Detection},
  author = {Nadezhda Zueva and Madina Kabirova and Pavel Kalaidin},
  journal= {arXiv preprint arXiv:2010.11666},
  year   = {2020}
}