中文

Retriv 在 BLP-2025 任务 1:基于变换模型集成与多任务学习的孟加拉种族仇恨语音识别

计算与语言 2025-11-11 v1

摘要

本文解决了孟加拉语仇恨语音识别问题,这是一个具有社会影响力却在语言上具有挑战性的任务。作为“孟加拉多任务仇恨语音识别”共享任务(BLP 工作坊,IJCNLP-AACL 2025)的一部分,我们队伍“Retriv”参与了所有三个子任务:(1A)仇恨类型分类、(1B)目标群体识别、(1C)联合检测类型、严重程度和目标。对于子任务 1A 和 1B,我们采用变换模型(BanglaBERT、MuRIL、IndicBERTv2)的软投票集成。对于子任务 1C,我们训练了三个多任务变体,并通过加权投票集成来聚合其预测。我们的系统在子任务 1A 和 1B 上分别获得了 72.75% 和 72.69% 的微-F1 分数,子任务 1C 上获得了 72.62% 的加权微-F1 分数。在共享任务排行榜上,这分别对应第 9、10 和第 7 名。这些结果突显了在资源有限的环境中,通过变换模型集成和加权多任务框架来推动孟加拉仇恨语音检测的前景。我们已公开实验脚本供社区使用。

关键词

引用

@article{arxiv.2511.07304,
  title  = {Retriv at BLP-2025 Task 1: A Transformer Ensemble and Multi-Task Learning Approach for Bangla Hate Speech Identification},
  author = {Sourav Saha and K M Nafi Asib and Mohammed Moshiul Hoque},
  journal= {arXiv preprint arXiv:2511.07304},
  year   = {2025}
}

备注

7 pages, 3 figures, experimental scripts publicly available at https://github.com/sahasourav17/Retriv-BLP25-Task-1