基于 BERT 的集成方法用于仇恨言论检测
计算与语言
2022-09-16 v2 机器学习
摘要
随着在线社交媒体提供的交流自由,仇恨言论日益滋生。这导致了影响个人和国家层面社会生活的网络冲突。因此,在仇恨内容被发送至社交网络之前对其进行过滤,对仇恨内容分类的需求日益增长。本文聚焦于利用多种深度模型对社交媒体中的仇恨言论进行分类,这些模型通过集成近期基于 transformer 的语言模型(如 BERT)与神经网络实现。为提升分类性能,我们评估了若干集成技术,包括软投票、最大值、硬投票和堆叠。我们使用了三个公开可用的 Twitter 数据集(Davidson、HatEval2019、OLID),它们用于识别攻击性语言。我们将所有这些数据集融合生成一个单一数据集(DHO 数据集),其在不同标签间更为平衡,以进行多标签分类。我们的实验在 Davidson 数据集和 DHO 语料上进行。后者给出了最佳总体结果,尤其是 F1 macro 分数,尽管其需要更多资源(执行时间与内存)。实验显示出良好结果,尤其是集成模型,其中堆叠在 Davidson 数据集上给出 97% 的 F1 分数,聚合集成在 DHO 数据集上给出 77% 的 F1 分数。
引用
@article{arxiv.2209.06505,
title = {BERT-based Ensemble Approaches for Hate Speech Detection},
author = {Khouloud Mnassri and Praboda Rajapaksha and Reza Farahbakhsh and Noel Crespi},
journal= {arXiv preprint arXiv:2209.06505},
year = {2022}
}