中文

IITR-CIOL@天城文脚本语言自然语言理解2025:天城文脚本语言中的多语言仇恨言论检测与目标识别

计算与语言 2024-12-31 v2

摘要

本研究聚焦于天城文脚本语言(特别是印地语、马拉地语、尼泊尔语、博杰普尔语和梵语)中仇恨言论检测和目标识别的两个子任务。子任务B涉及检测在线文本中的仇恨言论,而子任务C要求识别仇恨言论的具体目标,如个人、组织或社区。我们提出了MultilingualRobertaClass模型,这是一个基于多语言转换器模型ia-multilingual-transliterated-roberta的深度神经网络,针对多语言和音译背景下的分类任务进行了优化。该模型利用上下文嵌入来处理语言多样性,并带有一个用于二分类的分类头。我们在子任务B中获得了88.40%的准确率,在子任务C中获得了66.11%的准确率(基于测试集)。

关键词

引用

@article{arxiv.2412.17947,
  title  = {IITR-CIOL@NLU of Devanagari Script Languages 2025: Multilingual Hate Speech Detection and Target Identification in Devanagari-Scripted Languages},
  author = {Siddhant Gupta and Siddh Singhal and Azmine Toushik Wasi},
  journal= {arXiv preprint arXiv:2412.17947},
  year   = {2024}
}

备注

Accepted to CHiPSAL Workshop at COLING 2025