基于微调转换模型的孟加拉语言仇恨言论分类
计算与语言
2025-12-03 v1
摘要
由于数据不足、字形异质性和语言多样性,低资源语言的仇恨言论识别仍然是一个具有挑战性的问题。孟加拉语被超过 2300 万人口(来自孟加拉和印度西孟加拉)使用。尽管社交媒体平台上自动化监管的需求日益增长,但孟加拉语在计算资源中显著得不到代表。本文研究了 BLP 2025 共享任务中仇恨言论检测的子任务 1A 和子任务 1B。我们复现了官方基线方法(如多数投票、随机、支持向量机),并考虑了逻辑回归、随机森林和决策树等基线方法。我们还利用了诸如 DistilBERT、BanglaBERT、m-BERT 和 XLM-RoBERTa 等基于转换结构的模型进行仇恨言论分类。所有基于转换结构的模型在子任务中均优于基线方法,除非是 DistilBERT。 在所有基于转换结构的模型中,BanglaBERT 在两个子任务中表现最佳。尽管其规模较小,BanglaBERT 仍优于 m-BERT 和 XLM-RoBERTa,这表明语言特定的预训练非常重要。我们的结果凸显了为低资源孟加拉语构建预训练语言模型的潜力与必要性。
关键词
引用
@article{arxiv.2512.02845,
title = {Bangla Hate Speech Classification with Fine-tuned Transformer Models},
author = {Yalda Keivan Jafari and Krishno Dey},
journal= {arXiv preprint arXiv:2512.02845},
year = {2025}
}