中文

高效仇恨言论检测:基于三层 LoRA 调优 BERTweet 框架

计算与语言 2025-11-11 v1

摘要

本文致力于开发具备实时部署实用性且保持竞争性能的高效仇恨言论检测系统。我们提出了一种新颖的三层框架,结合基于规则的预过滤、参数高效的 LoRA 调优 BERTweet 模型以及持续学习能力。该方法 achieves 0.85 的宏平均 F1 分数——以 94% 的性能等效于基于 SafePhi(基于 Phi-4)的前沿大型语言模型,同时使用参数量为 1340 万的基础模型(相较于 140 亿参数),实现了 100 倍的参数规模压缩。与计算资源类似的传统 BERT 类方法相比,我们的方法通过战略性的数据集统一和优化微调实现了卓越的性能。该系统仅需 187 万可训练参数(占全参数微调的 1.37%),在单张 T4 GPU 上约 2 小时即可完成训练,使资源受限环境下的鲁棒仇恨言论检测成为可能,同时保持实战部署的竞争准确性。

关键词

引用

@article{arxiv.2511.06051,
  title  = {Efficient Hate Speech Detection: A Three-Layer LoRA-Tuned BERTweet Framework},
  author = {Mahmoud El-Bahnasawi},
  journal= {arXiv preprint arXiv:2511.06051},
  year   = {2025}
}

备注

13 pages, 2 figures