识别社交媒体中的网络滥用角色
机器学习
2024-12-24 v1 计算与语言
计算机与社会
社会与信息网络
摘要
社交媒体已彻底革新了通信方式,使全球人群能够即时连接和交互。然而,它也导致网络滥用增加,这对全球儿童和青少年构成重大威胁,影响其心理健康和福祉。准确检测网络滥用事件中涉及者的角色对于大规模有效应对此问题至关重要。本研究探讨了使用机器学习模型检测网络滢用互动中涉及者角色的方法。经过审查 AMiCA 数据集并解决类别不平衡问题,我们评估了使用四个基础 LLM (即 BERT、RoBERTa、T5 和 GPT-2) 构建的各种模型的性能。我们的分析表明,过采样技术有助于提高模型性能。最佳模型是使用过采样数据微调的 RoBERTa,获得整体 F1 分数为 83.5%,应用预测阈值后提升至 89.3%。未加阈值的 top-2 F1 分数为 95.7%。我们的方法优于先前提出的模型。经过对各类别模型性能和置信度得分的调查,我们发现模型在样本更多且上下文混淆较少的类别 (例如 Bystander Other) 中表现良好,但在样本较少且更具上下文歧义的类别 (例如 Harasser 和 Victim) 中表现较差。本工作凸显了在有限数据和复杂情境下开发准确模型的当前优势和局限性。
引用
@article{arxiv.2412.16417,
title = {Identifying Cyberbullying Roles in Social Media},
author = {Manuel Sandoval and Mohammed Abuhamad and Patrick Furman and Mujtaba Nazari and Deborah L. Hall and Yasin N. Silva},
journal= {arXiv preprint arXiv:2412.16417},
year = {2024}
}