中文

用模型无关方法解释仇恨言论分类

计算与语言 2023-06-02 v1 人工智能 人机交互 社会与信息网络

摘要

机器学习与人工智能取得了显著突破,尤其是在自然语言处理和深度学习领域。此外,随着社交媒体的广泛使用,对话中的仇恨言论检测在自然语言处理研究者中日益受到关注。然而,近期趋势表明,人们对 AI 模型可解释性与可理解性维度的需求已深刻显现。鉴于上述因素,本文的研究目标是弥合仇恨言论预测与系统为支持其决策所生成解释之间的鸿沟。为此,我们首先预测文本的分类,然后提供一种事后、模型无关且代理的可解释性方法以实现可解释性并防止模型偏差。双向 Transformer 模型 BERT 因其优于其他机器学习模型的先进效率而被用于预测。模型无关算法 LIME 为训练好的分类器输出生成解释,并预测影响模型决策的特征。对模型生成的预测进行了人工评估,经详尽评估后我们观察到,该模型在预测并解释其预测方面表现高效。最后,我们提出了扩展所提供研究工作的进一步方向。

关键词

引用

@article{arxiv.2306.00021,
  title  = {Explaining Hate Speech Classification with Model Agnostic Methods},
  author = {Durgesh Nandini and Ute Schmid},
  journal= {arXiv preprint arXiv:2306.00021},
  year   = {2023}
}

备注

15 pages Accepted paper from Text Mining Workshop at KI 2022