中文

基于 LLM 的多任务孟加拉仇恨言论检测:类型、严重程度与目标

计算与语言 2025-10-03 v1

摘要

在线社交媒体平台是日常沟通和信息检索的中心。尽管这些平台服务于积极目的,但也为仇恨言论、冒犯语言以及针对个人、组织和社区的欺凌内容的传播提供了肥沃土壤。此类内容削弱了线上安全感、参与度和平等感。因此,尤其在资源有限的语言中,需要可靠的检测系统,因为这些地区的 moderation 工具有限。在孟加拉语中,已有研究贡献了资源和模型,但大多数是单任务(例如二元仇恨/冒犯)且覆盖有限的多维信号(类型、严重程度、目标)。我们填补了这一空白,引入了第一个多任务孟加拉仇恨言论数据集——BanglaMultiHate,这是目前规模最大的人工标注语料库之一。基于这一资源,我们进行了全面的、受控比较,涵盖经典基线、单语言预训练模型和 LLM 在 zero-shot 提示和 LoRA 微调下的表现。我们的实验评估了 LLM 在资源受限情境下的适应性,并发现尽管 LoRA 微调的 LLM 与 BanglaBERT 相当,但在文化和语言层面上更为贴合的预训练仍对实现稳健性能至关重要。我们的数据集和发现为在资源受限环境中开发更贴合文化的 moderation 工具奠定了更坚实的基准。为保证可重复性,我们将公开数据集及相关脚本。

关键词

引用

@article{arxiv.2510.01995,
  title  = {LLM-Based Multi-Task Bangla Hate Speech Detection: Type, Severity, and Target},
  author = {Md Arid Hasan and Firoj Alam and Md Fahad Hossain and Usman Naseem and Syed Ishtiaque Ahmed},
  journal= {arXiv preprint arXiv:2510.01995},
  year   = {2025}
}