中文

NLPineers@ 2025 天城文字语言的 NLU:基于 BERT 模型集成的仇恨言论检测

计算与语言 2024-12-13 v2

摘要

本文探索了天城文字语言(聚焦于印地语和尼泊尔语)中的仇恨言论检测,针对 COLING 2025 共享任务 CHIPSAL 的子任务 B。我们使用了多种基于Transformer的模型,如 XLM-RoBERTa、MURIL 和 IndicBERT,研究它们在驾驭仇恨言论与自由表达之间微妙边界方面的有效性。我们表现最佳的模型——多语言 BERT 模型集成——实现了召回率 0.7762(按召回率排名第 3/31)和 F1 分数 0.6914(排名第 17/31)。为解决类别不平衡问题,我们采用了反向翻译进行数据增强,并利用余弦相似度在增强后保持标签一致性。本工作强调了在天城文字语言中进行仇恨言论检测的必要性,并为进一步研究奠定了基础。

关键词

引用

@article{arxiv.2412.08163,
  title  = {NLPineers@ NLU of Devanagari Script Languages 2025: Hate Speech Detection using Ensembling of BERT-based models},
  author = {Anmol Guragain and Nadika Poudel and Rajesh Piryani and Bishesh Khanal},
  journal= {arXiv preprint arXiv:2412.08163},
  year   = {2024}
}