中文

可解释的高性能仇恨与攻击性言论检测

计算与语言 2023-09-26 v2 机器学习

摘要

信息通过社交媒体平台的传播可能营造对弱势社群敌对的环境,并使社会中的某些群体失声。为缓解此类现象,已开发出若干模型用于检测仇恨与攻击性言论。由于社交媒体平台上的仇恨与攻击性言论检测可能错误地排除个体,从而降低信任,因此需要创建可解释且可理解的模型。为此,我们基于XGBoost算法,在Twitter数据上训练,构建了一个可解释且可理解的高性能模型。对于不平衡的Twitter数据,XGBoost在仇恨言论检测上优于LSTM、AutoGluon和ULMFiT模型,其F1分数为0.75,而后者分别为0.38、0.37和0.38。当我们将数据下采样为约5000条推文的三个独立类别时,XGBoost表现优于LSTM、AutoGluon和ULMFiT;在仇恨言论检测上的F1分数分别为0.79对比0.69、0.77和0.66。在攻击性言论检测的下采样版本中,XGBoost也优于LSTM、AutoGluon和ULMFiT,F1分数为0.83对比0.88、0.82和0.79。我们对XGBoost模型输出使用Shapley加性解释(SHAP)使其可解释且可理解,而LSTM、AutoGluon和ULMFiT为黑盒模型。

关键词

引用

@article{arxiv.2206.12983,
  title  = {Explainable and High-Performance Hate and Offensive Speech Detection},
  author = {Marzieh Babaeianjelodar and Gurram Poorna Prudhvi and Stephen Lorenz and Keyu Chen and Sumona Mondal and Soumyabrata Dey and Navin Kumar},
  journal= {arXiv preprint arXiv:2206.12983},
  year   = {2023}
}