中文

哈萨语性别歧视检测的数据集创建与基线模型

计算与语言 2025-11-03 v1 人工智能

摘要

性别歧视通过强化刻板印象、偏见和歧视性规范,加剧了性别不平等和社会排斥。鉴于在线平台使各种形式的性别歧视得以盛行,有效的性别歧视检测和缓解策略日益重要。虽然在高资源语言中计算方法应用于性别歧视检测已广泛存在,但在低资源语言中仍有限,由于语言资源有限以及文化差异影响性别表达和感知方式。本研究介绍了首个哈萨语性别歧视检测数据集,通过社区参与、定性编码和数据增强开发而成。为体现文化细微差别和语言表征,我们进行了两阶段用户研究(共66名),涉及母语者,探讨性别歧视在日常话语中如何被定义和表达。我们进一步使用传统机器学习分类器和预训练的多语言语言模型,评估了少样本学习在哈萨语性别歧视检测中的有效性。我们的发现突显了在捕捉文化细微差别方面的挑战,尤其是涉及澄清寻求和习语表达的情况,且显示出许多误报的倾向。

关键词

引用

@article{arxiv.2510.27038,
  title  = {Dataset Creation and Baseline Models for Sexism Detection in Hausa},
  author = {Fatima Adam Muhammad and Shamsuddeen Muhammad Hassan and Isa Inuwa-Dutse},
  journal= {arXiv preprint arXiv:2510.27038},
  year   = {2025}
}

备注

9 pages, 1 figure, 4 tables