基于 PhoBERT-CNN 与社交媒体流数据的越南语仇恨与攻击性检测
计算与语言
2022-06-02 v1 人工智能
机器学习
摘要
社会需要开发一套仇恨与攻击性检测系统,以构建健康安全的环境。然而,该领域的现有研究仍面临四大不足:预处理技术欠缺、忽视数据不平衡问题、模型性能平平以及缺乏实际应用。本文致力于开发一套能够克服上述不足的智能系统。首先,我们提出一种高效的预处理技术,以清洗从越南社交媒体收集的评论。其次,提出一种新颖的仇恨语音检测(HSD)模型,该模型结合预训练的 PhoBERT 模型与 Text-CNN 模型,用于解决越南语任务。第三,应用 EDA 技术处理不平衡数据,以提升分类模型性能。此外,我们进行了多项基线实验,以比较并考察所提模型相对于 SOTA 方法的性能。实验结果表明,所提 PhoBERT-CNN 模型优于 SOTA 方法,在两个基准数据集 ViHSD 与 HSD-VLSP 上分别取得 67.46% 与 98.45% 的 F1 分数。最后,我们还构建了一个流式 HSD 应用,以展示所提系统的实用性。
引用
@article{arxiv.2206.00524,
title = {Vietnamese Hate and Offensive Detection using PhoBERT-CNN and Social Media Streaming Data},
author = {Khanh Q. Tran and An T. Nguyen and Phu Gia Hoang and Canh Duc Luu and Trong-Hop Do and Kiet Van Nguyen},
journal= {arXiv preprint arXiv:2206.00524},
year = {2022}
}