中文

口语到网页:巴基斯坦零资源语言的数字化

计算与语言 2026-03-09 v2 人机交互

摘要

我们提出了 Multilingual Cloud Corpus,即巴基斯坦少数民族和原住民语言的第一个全国规模、平行的、多模态语言数据集。尽管巴基斯坦约有 40 种少数语言跨越四大语言家族,但迄今为止缺乏面向这些主要口头、计算上被称为“零资源”语言(14 种列为濒危语言)的系统性、跨家族数字语料库。我们的语料库包含 85792 条结构化文本条目,每条包含孟加拉 stimulus 文本、英文翻译以及 IPA 转写,以及约 107 小时的转录音频,覆盖来自西藏-缅甸语族、印欧语族、东南亚语族和达罗毗涅语族的 42 种语言变体,外加两种无归属语言。数据通过在巴基斯坦九个地区持续 90 天的系统化野外调查收集,涉及 16 名数据收集者、77 名说话人和 43 名验证者,遵循包含 2224 项独特项目的预定义elicitation 模板,这些项目在三个语言粒度层次上组织:孤立词 (跨 22 个语义领域的 475 个词)、句法构造 (跨 21 类的 887 句子,包括动词变位范式)以及定向语音 (跨 46 个对话情境的 862 条提示)。后期处理包括 10 名语言学家进行 IPA 转写及 6 名审阅者的独立裁决。该完整数据集可通过 Multilingual Cloud 平台 (multiling.cloud)公开获取,为所有记录的语言变体提供可检索的带标注音频和文本数据。我们描述了语料库设计、野外调查方法、数据集结构以及各语言覆盖情况,并讨论了对濒危语言文献学、低资源 NLP 以及在语言多样化发展中国家的数字化保存的影响。

关键词

引用

@article{arxiv.2603.05272,
  title  = {Oral to Web: Digitizing 'Zero Resource'Languages of Bangladesh},
  author = {Mohammad Mamun Or Rashid},
  journal= {arXiv preprint arXiv:2603.05272},
  year   = {2026}
}