中文

Subasa - 适配语言模型用于僧伽罗语低资源冒犯性语言检测

计算与语言 2025-04-07 v1

摘要

准确检测冒犯性语言对于与社交媒体安全相关的众多应用至关重要。低资源语言和高资源语言在此任务上的表现存在鲜明对比。在本文中,我们采用了以前未曾用于僧伽罗语的微调策略,以完成冒犯性语言检测的下游任务。利用这种方法,我们引入了四个模型:“Subasa-XLM-R”,它包含一个使用掩码理由预测的中间预微调步骤;以及“Subasa-Llama”和“Subasa-Mistral”的两个变体,分别是 Llama (3.2) 和 Mistral (v0.3) 的微调版本,采用了任务特定策略。我们在用于僧伽罗语冒犯性语言检测的 SOLD 基准数据集上评估了我们的模型。我们所有的模型均优于现有基线。Subasa-XLM-R 取得了最高的 Macro F1 分数(0.84),在零样本设置下于相同的 SOLD 基准数据集上进行评估时,超越了如 GPT-4o 等最先进的大型语言模型。模型和代码已公开提供。

关键词

引用

@article{arxiv.2504.02178,
  title  = {Subasa - Adapting Language Models for Low-resourced Offensive Language Detection in Sinhala},
  author = {Shanilka Haturusinghe and Tharindu Cyril Weerasooriya and Marcos Zampieri and Christopher M. Homan and S. R. Liyanage},
  journal= {arXiv preprint arXiv:2504.02178},
  year   = {2025}
}

备注

Accepted to appear at NAACL SRW 2025