中文

面向网络暴力检测的机器学习偏差探索与评估

机器学习 2024-12-03 v1

摘要

众所周知,机器学习模型的有用之处在于其能够泛化到未见数据。本研究使用三个流行的网络暴力数据集,探讨数据收集方式和标注方式对结果机器学习模型的影响。详细讨论了由于不同网络暴力定义和数据收集方式引入的偏差。我们着重强调数据扩充方法的影响,这些方法利用当前数据点获取和标注新数据。此外,进行了明确的测试,以评估模型泛化到未见数据集的能力通过跨数据集评估。如期望的那样,模型在宏平均F1分数上有显著下降,平均下降0.222。因此,本研究有效地凸显了数据策划和跨数据集测试的重要性,以创建具有现实应用性的模型。实验和其他代码可在 https://github.com/rootdrew27/cyberbullying-ml 查找。

关键词

引用

@article{arxiv.2412.00609,
  title  = {Exploration and Evaluation of Bias in Cyberbullying Detection with Machine Learning},
  author = {Andrew Root and Liam Jakubowski and Mounika Vanamala},
  journal= {arXiv preprint arXiv:2412.00609},
  year   = {2024}
}

备注

8 pages, 6 figures