中文

通过层冻结和可解释人工智能提升多语言仇恨言论检测的准确率与可解释性

计算与语言 2026-01-07 v1

摘要

情感分析旨识别文本数据中表达的情感极性,通常categorized为positive、negative或neutral。仇恨言论检测则旨在识别指向基于种族、性别、性取向或宗教等属性的个人或群体的暴力、歧视或敌意行为。两者均在线内容 moderation中发挥关键作用,通过检测和缓解有害或冒犯性内容,构建更安全的数字环境。本研究考察了三种基于transformer的模型:BERT-base-multilingual-cased、RoBERTa-base和XLM-RoBERTa-base,通过冻结前8层,对多语言情感分析和仇恨言论检测进行评估。评估覆盖英语、韩语、日语、中文和法语五种语言。模型使用准确率、精确率、召回率和F1-score等标准性能指标进行比较。为增强模型可解释性并提供对预测行为的深入见解,我们集成Local Interpretable Model-agnostic Explanations (LIME)框架,该框架突出显示 individual words对模型决策的贡献。通过将最先进的transformer架构与可解释性技术相结合,本工作旨在提高多语言情感分析和仇恨言论检测系统的有效性和透明度。

关键词

引用

@article{arxiv.2601.02697,
  title  = {Boosting Accuracy and Interpretability in Multilingual Hate Speech Detection Through Layer Freezing and Explainable AI},
  author = {Meysam Shirdel Bilehsavar and Negin Mahmoudi and Mohammad Jalili Torkamani and Kiana Kiashemshaki},
  journal= {arXiv preprint arXiv:2601.02697},
  year   = {2026}
}

备注

19 pages, 7 figures