中文

基于情感自适应训练的网络欺凌与诽谤检测

计算与语言 2025-01-29 v1

摘要

现有研究在社交媒体上检测网络欺凌事件主要集中于欺凌行为,通常被建模为二分类任务。然而,网络欺凌涵盖多种形式,如贬低和欺凌,名人常面临此类事件。此外,针对这些多样化的网络欺凌形式的合适训练数据仍稀缺。本研究首先构建了一个覆盖两种不同类型事件的名人网络欺凌数据集:欺凌和诽谤。我们检验了各种类型的基于 transformer 的模型,即遮蔽型 (RoBERTa、Bert 和 DistilBert)、替换型 (Electra)、自回归型 (XLNet)、遮蔽置换型 (Mpnet)、文本文本型 (T5) 以及大语言模型 (Llama2 和 Llama3),并在低资源设置下进行实验。我们发现它们在显式欺凌二分类检测方面表现竞争力。然而,在欺凌和贬低多分类任务中,其性能显著下降。因此,我们提出一种情感自适应训练框架 (EAT),通过将情感检测领域的知识迁移到网络欺凌检测领域,以帮助检测间接网络欺凌事件。EAT 在九个基于 transformer 的模型下, consistently 改善了网络欺凌检测任务中平均宏 F1、精确率和召回率,提升幅度为 20%。我们的论点得到直观的理论洞见和大量实验的支持。

关键词

引用

@article{arxiv.2501.16925,
  title  = {Detecting harassment and defamation in cyberbullying with emotion-adaptive training},
  author = {Peiling Yi and Arkaitz Zubiaga and Yunfei Long},
  journal= {arXiv preprint arXiv:2501.16925},
  year   = {2025}
}