机器学习算法在网络欺凌检测中的比较性能:使用土耳其语预处理技术
计算机与社会
2021-02-01 v1
摘要
随着互联网和社交媒体的日益普及,网络欺凌显然已成为一个主要问题。防范网络欺凌危险后果的最基本方法,是主动检测并管控含有网络欺凌的内容。审视当今互联网和社交媒体统计数据,仅依靠人力无法检测网络欺凌内容。为使社交媒体成为安全的通信空间,必须采用有效的网络欺凌检测方法。当前的研究工作聚焦于利用机器学习来检测并消除网络欺凌。尽管大多数研究针对英文文本进行网络欺凌检测,但土耳其语相关研究甚少。在土耳其语研究中采用的方法和算法也较为有限。此外,用于分类含网络欺凌文本的那些算法的适用范围与性能各异,这凸显了选用合适算法的重要性。本研究旨在比较不同机器学习算法在检测含网络欺凌的土耳其语消息时的性能。本研究中使用了十九种不同的分类算法,借助土耳其语自然语言处理技术来识别含网络欺凌的文本。采用精确率、召回率、准确率和 F1 分数值评估分类器性能。结果表明,Light Gradient Boosting Model(LGBM)算法表现最佳,准确率为 90.788%,F1 分数值为 90.949%。
引用
@article{arxiv.2101.12718,
title = {Comparative Performance of Machine Learning Algorithms in Cyberbullying Detection: Using Turkish Language Preprocessing Techniques},
author = {Emre Cihan Ates and Erkan Bostanci and Mehmet Serdar Guzel},
journal= {arXiv preprint arXiv:2101.12718},
year = {2021}
}