中文

面向低 Web 数据语言的机器翻译数据集评估:从性别视角出发

计算与语言 2025-11-07 v1 计算机与社会

摘要

随着低资源语言日益被纳入 NLP 研究,强调收集大规模数据集。但在追求数量而非质量方面,我们风险包括:1) 构建的语言技术表现不佳,以及2) 产生有害内容并延续社会偏见。在本文中,我们调查了针对三种低资源语言——阿发诺尔语、阿姆哈拉语和提格尼亚语——的机器翻译 (MT) 数据集质量,重点关注性别表示。我们的发现表明,尽管训练数据在政治和宗教领域文本表示占比较大,但基准数据集聚焦于新闻、健康和体育。我们还发现对男性性别的偏斜显而易见——在人名中、动词的语法性别以及数据集中的刻板性描绘方面。此外,我们发现针对女性的有害和有毒描绘,随着数据量最大的语言呈现更为突出,凸显了数量并不等于质量的事实。我们希望我们的工作能激发对低资源语言收集的数据集的进一步探讨,并促使及早缓解有害内容。WARNING:本文包含讨论可能令人不适的 NSFW 内容。

关键词

引用

@article{arxiv.2511.03880,
  title  = {Evaluating Machine Translation Datasets for Low-Web Data Languages: A Gendered Lens},
  author = {Hellina Hailu Nigatu and Bethelhem Yemane Mamo and Bontu Fufa Balcha and Debora Taye Tesfaye and Elbethel Daniel Zewdie and Ikram Behiru Nesiru and Jitu Ewnetu Hailu and Senait Mengesha Yayo},
  journal= {arXiv preprint arXiv:2511.03880},
  year   = {2025}
}

备注

Paper Under Review