评估社交媒体平台网络欺凌检测的文本分类方法
计算与语言
2024-12-31 v1 社会与信息网络
摘要
网络欺凌通过负面影响受害者的心理,显著加剧了社区的心理健康问题。这是社交媒体平台上一个普遍存在的问题,需要有效的实时检测和监控系统来识别有害信息。然而,当前的网络欺凌检测系统在性能、数据集质量、时间效率和计算成本方面面临挑战。本研究旨在通过调整和评估网络欺凌检测领域内现有的文本分类技术来进行比较研究。该研究特别评估了这些技术在识别社交媒体平台上网络欺凌实例方面的有效性和性能。重点是利用和评估大型语言模型,包括BERT、RoBERTa、XLNet、DistilBERT和GPT-2.0,以确定它们在该领域的适用性。结果表明,BERT在性能、时间效率和计算资源之间取得了平衡:准确率95%、精确率95%、召回率95%、F1分数95%、错误率5%、推理时间0.053秒、RAM使用35.28 MB、CPU/GPU使用率0.4%、能耗0.000263 kWh。研究结果表明,生成式AI模型虽然强大,但在测试基准上并不总是优于微调模型。然而,通过对现有模型进行策略性调整和微调以适应特定数据集和任务,仍然可以实现最先进的性能。
引用
@article{arxiv.2412.19928,
title = {Assessing Text Classification Methods for Cyberbullying Detection on Social Media Platforms},
author = {Adamu Gaston Philipo and Doreen Sebastian Sarwatt and Jianguo Ding and Mahmoud Daneshmand and Huansheng Ning},
journal= {arXiv preprint arXiv:2412.19928},
year = {2024}
}
备注
15 pages, 10 figures, 7 tables