印尼语 Twitter 二元仇恨言论检测中 PyCaret AutoML 与 CNN-BiLSTM 的比较研究
计算与语言
2026-05-07 v1
摘要
本文比较了 PyCaret AutoML 分支和 CNN-BiLSTM 分支,用于使用 Ibrohim 和 Budi 语料库中的 HS 标签进行印尼语 Twitter 上的二元仇恨言论检测。两个分支共享相同的预处理流水线,以便比较反映建模差异而非不一致的数据准备。传统分支使用 TF-IDF 结合基于词典的脏话计数,而神经分支学习密集 token 表示并捕获局部短语模式和双向上下文。基准测试基于发布的 13,130 行标注表构建,其 HS 标签产生 58:42 的类别比例。在留出集上,CNN-BiLSTM 取得了最佳结果,准确率为 83.8%,精确率为 79.8%,召回率为 82.7%,F1 分数为 81.2%。在 PyCaret 分支内,随机森林是最强的传统模型,准确率为 77.2%,F1 分数为 77.0%。因此,神经分支将准确率提高了 6.6 个百分点,F1 分数提高了 4.2 个百分点。探索性语料库分析、学习曲线和混淆矩阵表明,该数据集为短文本,存在中度不平衡,且仍然具有难度,因为许多决策依赖于局部词汇线索加上简短的上下文组合。研究得出结论,PyCaret AutoML 是一个有效的传统基准测试框架,而 CNN-BiLSTM 是所报告基准设置下更强的最终模型。
引用
@article{arxiv.2605.04885,
title = {A Comparative Study of PyCaret AutoML and CNN-BiLSTM for Binary Hate Speech Detection in Indonesian Twitter},
author = {Tanty Widiyastuti and Mayada and Adisty Syawalda Ariyanto and Luluk Muthoharoh and Ardika Satria and Martin Clinton Tosima Manullang},
journal= {arXiv preprint arXiv:2605.04885},
year = {2026}
}
备注
8 pages, 3 figures, and 1 table in the current manuscript. The paper presents a comparative study of PyCaret AutoML and CNN-BiLSTM for binary hate speech detection in Indonesian Twitter