基于 MURIL 与可解释 AI 的 Hinglish 文本网络欺凌检测
计算与语言
2025-06-23 v1
摘要
数字通信平台的增长导致全球范围内网络欺凌事件的增加,迫切需要自动化检测系统来保护用户。基于数字平台的印地语-英语(Hinglish)代码混合通信的兴起,给现有网络欺凌检测系统(主要为单语文本设计)带来了挑战。本文提出了一个针对 Hinglish 文本网络欺凌检测的框架,利用 Multilingual Representations for Indian Languages(MURIL)架构以应对当前方法的局限性。在六个基准数据集(Bohra 等人、BullyExplain、BullySentemo、Kumar 等人、HASOC 2021 和 Mendeley Indo-HateSpeech)上的评估显示,MURIL 方法优于现有多语言模型(包括 RoBERTa 和 IndicBERT),在 Bohra 上达到 86.97% 准确率,在 BullyExplain 上达到 84.62% 准确率,在 BullySentemo 上达到 86.03% 准确率,在 Kumar 数据集上达到 75.41% 准确率,在 HASOC 2021 上达到 83.92% 准确率,在 Mendeley 数据集上达到 94.63% 准确率。该框架通过归因分析和跨语言模式识别包含可解释性特征。消融研究表明,选择性层冻结、合适的分类头设计以及针对代码混合内容的专业化预处理可提高检测性能,而故障分析识别了包括语境依赖解释、文化理解和跨语言讽刺检测在内的挑战,为未来多语言网络欺凌检测研究提供了方向。
引用
@article{arxiv.2506.16066,
title = {Cyberbullying Detection in Hinglish Text Using MURIL and Explainable AI},
author = {Devesh Kumar},
journal= {arXiv preprint arXiv:2506.16066},
year = {2025}
}