中文

大型语言模型在网络欺凌检测中的应用

计算与语言 2024-02-07 v1 人工智能 机器学习 应用统计

摘要

社交媒体的主导地位为欺凌者增加了欺凌渠道。不幸的是,网络欺凌(CB)是当今网络世界中最普遍的现象,对公民的身心健康构成严重威胁。这带来了开发一个稳健系统的需求,以阻止来自在线论坛、博客和社交媒体平台的欺凌内容,从而管理其对我们的社会的影响。为此已提出了多种机器学习(ML)算法。然而,由于高类别不平衡和泛化问题,它们的性能并不稳定。近年来,如 BERT 和 RoBERTa 等大型语言模型(LLM)在多项自然语言处理(NLP)任务中取得了 state-of-the-art(SOTA)的成果。不幸的是,LLM 尚未广泛应用于 CB 检测。在我们的论文中,我们探索了这些模型在网络欺凌(CB)检测中的使用。我们从现有研究(Formspring 和 Twitter)中准备了一个新数据集(D2)。我们在数据集 D1 和 D2 上的实验结果表明,RoBERTa 优于其他模型。

关键词

引用

@article{arxiv.2402.04088,
  title  = {The Use of a Large Language Model for Cyberbullying Detection},
  author = {Bayode Ogunleye and Babitha Dharmaraj},
  journal= {arXiv preprint arXiv:2402.04088},
  year   = {2024}
}

备注

14 pages, Journal of Analytics