中文

通过攻击性增强提示实现网络欺凌检测

计算与语言 2025-08-25 v2

摘要

社交媒体上网络欺凌的检测仍是一个关键挑战,由于其微妙且多样的表达方式。本研究探讨了将攻击性检测作为统一训练框架中的辅助任务整合,是否能提高大型语言模型(LLM)在网络欺凌检测方面的泛化和性能。在五个攻击性数据集和一个网络欺凌数据集上进行实验,使用指令调优的 LLM。我们评估了多种策略:零-shot、few-shot、独立 LoRA 微调和多任务学习(MTL)。鉴于 MTL 结果不一致,我们提出了一种丰富提示管道方法,其中将攻击性预测嵌入网络欺凌检测提示中以提供上下文增强。初步结果表明,丰富提示管道始终优于标准 LoRA 微调,表明攻击性信息的上下文显著提升了网络欺凌检测。这一研究突显了诸如攻击性检测等辅助任务对 LLM 在社交网络上针对安全关键应用的泛化能力的潜在影响。

关键词

引用

@article{arxiv.2508.06360,
  title  = {Cyberbullying Detection via Aggression-Enhanced Prompting},
  author = {Aisha Saeid and Anu Sabu and Girish A. Koushik and Ferrante Neri and Diptesh Kanojia},
  journal= {arXiv preprint arXiv:2508.06360},
  year   = {2025}
}

备注

Accepted to RANLP 2025