面向 AI 的用户专属网络欺凌严重程度检测及可解释性
机器学习
2025-04-16 v2 计算与语言
计算机与社会
摘要
社交媒体的兴起显著增加了网络欺凌 (CB) 的发生率,这对心理与身体健康构成严重风险。有效的检测系统对于减轻其影响至关重要。虽然已有多种机器学习 (ML) 模型开发,但很少将受害者的心理、人口统计学及行为因素纳入并结合欺凌评论来评估严重程度。本研究提出一种集成用户专属属性的 AI 模型,包括心理因素(自尊、焦虑、抑郁)、线上行为(网络使用情况、纪律历史)以及人口统计学属性(种族、性别、民族),并与社交媒体评论一起使用。此外,我们引入了一种重新标注技术,将社交媒体评论分为三类严重程度:无欺凌、轻度欺凌和严重欺凌,考虑用户专属因素。我们的 LSTM 模型使用 146 个特征训练,包含社交媒体评论的情感、主题及 word2vec 表示,以及用户级别的属性,准确率达到最高的 98%,F1 分数为 0.97。为识别影响网络欺凌严重程度的关键因素,我们采用可解释 AI 技术(SHAP 和 LIME)来解释模型的决策过程。我们的发现表明,除仇恨言论外,属于特定种族和性别群体的受害者更常遭受攻击,且抑郁、纪律问题和自尊心低的发生率更高。此外,有欺凌史的个体更可能成为网络欺凌的受害者。
引用
@article{arxiv.2503.10650,
title = {AI Enabled User-Specific Cyberbullying Severity Detection with Explainability},
author = {Tabia Tanzin Prama and Jannatul Ferdaws Amrin and Md. Mushfique Anwar and Iqbal H. Sarker},
journal= {arXiv preprint arXiv:2503.10650},
year = {2025}
}