中文

面向低资源语言的参数高效微调:Bengali 仇恨言论检测中大语言模型的比较研究

计算与语言 2026-02-24 v1 人工智能 机器学习

摘要

孟加拉社交媒体平台上仇恨言论的数量有显著上升,尤其对女性和青少年造成了不成比例的影响。虽然数据集如 BD-SHS 提供了结构化评估的基础,但大多数先前方法要么依赖计算昂贵的全模型微调,要么依赖专有 API。本文首次将参数高效微调 (PEFT) 应用于孟加拉仇恨言论检测,使用 LoRA 和 QLoRA。对三个经过指令微调的大型语言模型——Gemma-3-4B、Llama-3.2-3B 和 Mistral-7B——在包含 50,281 条标注评论的 BD-SHS 数据集上进行微调。每个模型仅训练少于 1% 的参数,使我们能够在单个消费级 GPU 上完成实验。结果显示,Llama-3.2-3B 取得了最高的 92.23% F1 分数,其次是 Mistral-7B 的 88.94%,最后是 Gemma-3-4B 的 80.25%。这些发现表明 PEFT 是孟加拉及相关低资源语言的实用且可复制的策略。

关键词

引用

@article{arxiv.2510.16985,
  title  = {Parameter-Efficient Fine-Tuning for Low-Resource Languages: A Comparative Study of LLMs for Bengali Hate Speech Detection},
  author = {Akif Islam and Mohd Ruhul Ameen},
  journal= {arXiv preprint arXiv:2510.16985},
  year   = {2026}
}

备注

Accepted to IEEE COMPAS 2025. 6 pages, 3 figures, 6 tables