基于词汇增强和特征选择的 BERT 恶意言语检测
计算与语言
2025-12-03 v1 人工智能
神经与进化计算
摘要
社交媒体上的恶意言语是一 持续且不断演化的挑战,驱动着新型俚语和混淆术语的不断涌现,以规避检测系统。本文提出一种数据高效策略,用于对 BERT 在恶意言语分类上进行微调,通过显著减少训练集大小而不损失性能。我们采用 TF-IDF 基于样本选择机制保留仅最具信息性的 75% 的样本,从而最小化训练开销。为解决 BERT 本机词汇表在捕捉不断演化的恶意言语术语方面的局限性,我们增强了标记器,添加了常见于恶意语境中的特定领域俚语和词汇变体。实验结果表明,在广泛使用的数据集上,我们的方法在实现竞争性能的同时提高了计算效率,凸显了其在可扩展和自适应恶意内容监控中的潜力。
引用
@article{arxiv.2512.02141,
title = {Feature Selection Empowered BERT for Detection of Hate Speech with Vocabulary Augmentation},
author = {Pritish N. Desai and Tanay Kewalramani and Srimanta Mandal},
journal= {arXiv preprint arXiv:2512.02141},
year = {2025}
}