基于新型预处理序列与集成方法的仇恨内容检测
计算与语言
2024-09-10 v1
摘要
社交媒体,尤其是Twitter,仇恨言论和挑衅事件的增多显而易见。因此,识别仇恨言论已成为迫切需要的任务。本文引入了一个计算框架,以遏制网络上的仇恨内容。具体而言,本研究通过研究文本预处理操作序列对仇恨内容识别的影响,提出了一套详尽的预处理方法研究。当采用支持向量机、随机森林、决策树、逻辑回归和K近邻等流行的分类方法时,最佳预处理序列能够显著提升性能。此外,还将最佳预处理序列与不同集成方法(如装袋、提升和堆叠)结合使用,以进一步提高性能。本研究使用了三个公开的基准数据集(WZ-LS、DT和FOUNTA)进行评估。该方法实现了最高达95.14%的准确率,凸显了独特预处理方法以及集成分类器的有效性。
引用
@article{arxiv.2409.05134,
title = {Hate Content Detection via Novel Pre-Processing Sequencing and Ensemble Methods},
author = {Anusha Chhabra and Dinesh Kumar Vishwakarma},
journal= {arXiv preprint arXiv:2409.05134},
year = {2024}
}