使用大型语言模型进行仇恨言论检测:数据增强与特征增强
计算与语言
2026-03-06 v1 人工智能
摘要
本文评估了数据增强和特征增强技术用于仇恨言论检测,比较了传统分类器(如 Delta 词频-逆文档频率(Delta TF-IDF))与基于转换器的模型(DistilBERT、RoBERTa、DeBERTa、Gemma-7B、gpt-oss-20b)在多样化数据集上的表现。它考察了合成少数过采样技术(SMOTE)、由类比例逆向确定的加权损失、词性标注(POS)以及文本数据增强对模型性能的影响。开源的 gpt-oss-20b 持续实现最高的成绩。另一方面,Delta TF-IDF 对数据增强反应强烈,在 Stormfront 数据集上达到 98.2% 的准确率。该研究确认,隐式仇恨言论比显性仇恨内容更难检测,而增强效果取决于数据集、模型和技术之间的相互作用。我们的研究指导了仇恨言论检测的开发,突出了数据集属性、模型架构和增强策略之间的相互作用,支持更准确和情境感知的自动检测。
关键词
引用
@article{arxiv.2603.04698,
title = {Hate Speech Detection using Large Language Models with Data Augmentation and Feature Enhancement},
author = {Brian Jing Hong Nge and Stefan Su and Thanh Thi Nguyen and Campbell Wilson and Alexandra Phelan and Naomi Pfitzner},
journal= {arXiv preprint arXiv:2603.04698},
year = {2026}
}
备注
Accepted for publication in the Proceedings of the 8th International Conference on Natural Language Processing (ICNLP 2026)