IITR-CIOL@天城文脚本语言自然语言理解2025:天城文脚本语言中的多语言仇恨言论检测与目标识别
计算与语言
2024-12-31 v2
摘要
本研究聚焦于天城文脚本语言(特别是印地语、马拉地语、尼泊尔语、博杰普尔语和梵语)中仇恨言论检测和目标识别的两个子任务。子任务B涉及检测在线文本中的仇恨言论,而子任务C要求识别仇恨言论的具体目标,如个人、组织或社区。我们提出了MultilingualRobertaClass模型,这是一个基于多语言转换器模型ia-multilingual-transliterated-roberta的深度神经网络,针对多语言和音译背景下的分类任务进行了优化。该模型利用上下文嵌入来处理语言多样性,并带有一个用于二分类的分类头。我们在子任务B中获得了88.40%的准确率,在子任务C中获得了66.11%的准确率(基于测试集)。
引用
@article{arxiv.2412.17947,
title = {IITR-CIOL@NLU of Devanagari Script Languages 2025: Multilingual Hate Speech Detection and Target Identification in Devanagari-Scripted Languages},
author = {Siddhant Gupta and Siddh Singhal and Azmine Toushik Wasi},
journal= {arXiv preprint arXiv:2412.17947},
year = {2024}
}
备注
Accepted to CHiPSAL Workshop at COLING 2025