中文

基于词汇增强和特征选择的 BERT 恶意言语检测

计算与语言 2025-12-03 v1 人工智能 神经与进化计算

摘要

社交媒体上的恶意言语是一 持续且不断演化的挑战,驱动着新型俚语和混淆术语的不断涌现,以规避检测系统。本文提出一种数据高效策略,用于对 BERT 在恶意言语分类上进行微调,通过显著减少训练集大小而不损失性能。我们采用 TF-IDF 基于样本选择机制保留仅最具信息性的 75% 的样本,从而最小化训练开销。为解决 BERT 本机词汇表在捕捉不断演化的恶意言语术语方面的局限性,我们增强了标记器,添加了常见于恶意语境中的特定领域俚语和词汇变体。实验结果表明,在广泛使用的数据集上,我们的方法在实现竞争性能的同时提高了计算效率,凸显了其在可扩展和自适应恶意内容监控中的潜力。

关键词

引用

@article{arxiv.2512.02141,
  title  = {Feature Selection Empowered BERT for Detection of Hate Speech with Vocabulary Augmentation},
  author = {Pritish N. Desai and Tanay Kewalramani and Srimanta Mandal},
  journal= {arXiv preprint arXiv:2512.02141},
  year   = {2025}
}