中文

面向濒危 Athabaskan 语言的准确语言识别:以 Navajo 为例

计算与语言 2025-02-12 v2

摘要

濒危语言,如 Navajo — — 全球最广为人知的 Native 美洲语言 — — 在当代语言技术中严重缺乏覆盖,这加剧了其保存与复兴的挑战。本研究评估了 Google 语言识别 (LangID) 工具,该工具目前不支持任何 Native 美洲语言。为此,我们引入一个在 Navajo 和二十个被 LangID 误推荐的语言上训练的随机森林分类器。尽管该分类器结构简单,但实现了近乎完美的准确率(97-100%)。此外,该模型在其他 Athabaskan 语言上也表现出鲁棒性 — — 这一族语言主要分布在阿拉斯加、太平洋西北部及美国西南部部分地区 — — 表明其具有更广泛的应用潜力。我们的发现凸显了在多文化世界中支持底层语言的 NLP 系统迫切需要优先考虑语言多样性和适应性,而非集中式的通用解决方案,尤其是为被边缘化的语言提供支持。本工作直接推动了解决语言模型中文化偏见的持续努力,并倡导开发服务于多样化语言社区的本土化 NLP 工具。

关键词

引用

@article{arxiv.2501.15773,
  title  = {Is It Navajo? Accurate Language Detection in Endangered Athabaskan Languages},
  author = {Ivory Yang and Weicheng Ma and Chunhui Zhang and Soroush Vosoughi},
  journal= {arXiv preprint arXiv:2501.15773},
  year   = {2025}
}

备注

Accepted to NAACL 2025 Main