中文

基于 context-aware BanglaBERT 与两层堆叠 LSTM 框架的多标签网络暴力检测

计算与语言 2026-02-27 v1 人工智能 机器学习

摘要

网络暴力在当今虚拟世界中成为越来越严重且日益增长的关注点。若未及时察觉,可能会对社交和心理健康产生不利影响。研究人员探索了各种类型的网络暴力,但大多数方法使用单标签分类,假设每条评论仅包含一种滥用类型。实际上,单条评论可能包含重叠形式,如威胁、仇恨言论和骚扰。因此,多标签检测既现实又必不可少。然而,尤其在资源匮乏的语言如孟加拉语中,多标签网络暴力检测受到有限关注,稳健的预训练模型稀缺。开发具备中等准确度的通用模型仍具有挑战性。Transformer 具备强大的上下文理解能力,但可能忽略序列依赖性,而 LSTM 模型能够捕捉时间顺序但缺乏语义深度。为解决这些限制,我们提出一种融合架构,将 BanglaBERT-Large 与两层堆叠 LSTM 组合在一起。我们分析它们的行为,以联合建模上下文和序列。该模型在公开的多标签孟加拉语网络暴力数据集上进行微调和评估,涵盖网络暴力、性骚扰、威胁和垃圾信息。我们应用不同的抽样策略以解决类别不平衡问题。评估使用包括准确率、精确率、召回率、F1 分数、Hamming 损失、Cohen's Kappa 和 AUC-ROC 在内的多个指标。我们采用 5 折交叉验证来评估该架构的泛化能力。

关键词

引用

@article{arxiv.2602.22449,
  title  = {A Fusion of context-aware based BanglaBERT and Two-Layer Stacked LSTM Framework for Multi-Label Cyberbullying Detection},
  author = {Mirza Raquib and Asif Pervez Polok and Kedar Nath Biswas and Rahat Uddin Azad and Saydul Akbar Murad and Nick Rahimi},
  journal= {arXiv preprint arXiv:2602.22449},
  year   = {2026}
}