中文

迈向可泛化的仇恨言论检测:关于障碍与解决方案的综述

计算与语言 2021-02-18 v1

摘要

仇恨言论是一类有害的在线内容,其基于个人或群体实际或感知的身份特征(如族裔、宗教和性取向)直接攻击或煽动对其的仇恨。随着在线仇恨言论的增多,将其自动检测作为自然语言处理任务正获得越来越多的关注。然而,直到最近才表明,现有模型对未见数据的泛化能力很差。本综述论文试图总结现有仇恨言论检测模型的可泛化程度,分析仇恨言论模型难以泛化的原因,归纳应对主要障碍的现有尝试,并提出未来研究中改进仇恨言论检测泛化的方向。

关键词

引用

@article{arxiv.2102.08886,
  title  = {Towards generalisable hate speech detection: a review on obstacles and solutions},
  author = {Wenjie Yin and Arkaitz Zubiaga},
  journal= {arXiv preprint arXiv:2102.08886},
  year   = {2021}
}