中文

一种有效、稳健且公平性感知的仇恨言论检测框架

计算与语言 2024-09-27 v1 机器学习

摘要

随着在线社交网络的普及,仇恨言论的传播速度和损害都在加大。现有的仇恨言论检测方法在多个方面存在局限性,如处理数据不足、估计模型不确定性、提高对恶意攻击的鲁棒性以及处理意外偏见(即公平性)。在线社交网络中对仇恨言论进行准确、稳健和公平的分类迫切需要。为弥合这一差距,我们设计了一个数据增强、公平性处理和不确定性估计的新型框架。作为该框架的组成部分,我们提出了双向四元量-准LSTM层来平衡有效性和效率。为构建通用模型,我们将来自三个平台的五个数据集组合在一起。实验结果表明,我们的模型在无攻击情景以及各种攻击情景下均优于八个state-of-the-art方法,表明了该模型的有效性和稳健性。我们随意共享代码以及组合后的数据集以便更好地进行未来研究。

关键词

引用

@article{arxiv.2409.17191,
  title  = {An Effective, Robust and Fairness-aware Hate Speech Detection Framework},
  author = {Guanyi Mou and Kyumin Lee},
  journal= {arXiv preprint arXiv:2409.17191},
  year   = {2024}
}

备注

IEEE BigData 2021