UrduSpeech:一个包含 12 维语篇语言标注的 156 小时乌尔都语语料库
音频与语音处理
2026-05-19 v1
摘要
尽管乌尔都语拥有 2.3 亿使用者,仍在语音技术领域严重缺乏资源。我们引入 UrduSpeech:一个大规模高保真乌尔都语语料库,包含 156 小时的音频数据,涵盖 12 维语篇语言标注,包括 US-Std、US-CS、US-EngPk。为解决从右到左书写约束和频繁代码切换问题,我们开发了 UrduSpeech,一个由 LLM 驱动的管道,用于跨 12 个多样化类别(包括新闻、戏剧以及罕见文学形式如 Bait-Bazi)筛选数据。我们也发布了一个 9 小时的 US-Benchmark 数据集,由 native annotators 手动校正,作为标准基准。对主要 156 小时语料库的人类质量评估显示,平均意见得分(MOS)为 4.6(标准差 0.7),以 0.68 的 Cohen's Kappa 确认的项目间可靠性,验证了我们 curation 管道的 97.6% 置信度得分。该语料库在 71,792 条 utterance 上保持 60-40 的性别比例。我们的工作代表了全球 AI 语言包容性的重大进步。该语料库和代码已开源,并提供演示页面。
引用
@article{arxiv.2605.17846,
title = {UrduSpeech: A 156-Hour Urdu Speech Corpus with 12-Dimension Paralinguistic Annotations},
author = {Attia Nafees ul Haq and Zeyu Zhu and Jingbin Hu and ChunJiang He and Lei Xie},
journal= {arXiv preprint arXiv:2605.17846},
year = {2026}
}
备注
6 pages, 3 figures, 4 tables