豪萨语中攻击性在线内容的检测与分析
计算与语言
2025-03-10 v2
摘要
豪萨语是乍得语族的主要语言,主要分布于西非,使用人口超过一亿,从计算语言学角度看属于低资源语言。这一分类意味着处理各类自然语言处理(NLP)任务(包括攻击性内容检测)所需的语言资源和工具十分匮乏。为弥补这一缺口,我们开展了两组研究:(1)一项用户研究(n=101)以探究豪萨语中的网络欺凌现象;(2)一项实证研究,由此创建了首个豪萨语攻击性术语数据集。我们基于该数据集开发了检测系统,并将其性能与相关多语言模型(包括 Google 翻译)进行比较。我们的检测系统成功识别出超过 70% 的攻击性内容,而基线模型频繁误译此类术语。我们将这一差异归因于豪萨语的细微特性,以及基线模型因缺乏构建针对性检测系统的数据而依赖直接或字面翻译。这些发现凸显了在为豪萨语等低资源语言开发 NLP 模型时纳入文化语境和语言细微差别的重要性。事后分析进一步揭示,攻击性语言在涉及宗教和政治的讨论中尤为普遍。为营造更安全的网络环境,我们建议吸纳具备本地语境与人口特征专业知识的多元利益相关方。他们的见解对于开发更精准的检测系统以及符合文化敏感性的针对性审核策略至关重要。
引用
@article{arxiv.2311.10541,
title = {Detection and Analysis of Offensive Online Content in Hausa Language},
author = {Fatima Muhammad Adam and Abubakar Yakubu Zandam and Isa Inuwa-Dutse},
journal= {arXiv preprint arXiv:2311.10541},
year = {2025}
}
备注
21 pages, 4 figures, 7 tables