中文

IndicVoices:构建面向印度语言的包容性多语种语音数据集

计算与语言 2024-03-05 v1

摘要

我们提出了 INDICVOICES,一个包含自然和自发语音的数据集,共有 7348 小时的朗读(9%)、即兴(74%)和会话(17%)音频,来自覆盖 145 个印度地区和 22 种语言的 16237 名说话者。在这 7348 小时中,已有 1639 小时被转录,每种语言的中位数为 73 小时。通过本文,我们分享了捕捉印度文化、语言和人口多样性以创建独一无二的包容性和代表性数据集的历程。更具体地说,我们分享了一个用于大规模数据收集的开源蓝图,包含标准化协议、集中式工具、涵盖多个领域和感兴趣主题的引人入胜的问题、提示和会话场景库、质量控制机制、全面的转录指南和转录工具。我们希望这个开源蓝图能作为世界其他多语种地区数据收集工作的综合入门套件。使用 INDICVOICES,我们构建了 IndicASR,这是第一个支持印度宪法第八附表中所列全部 22 种语言的 ASR 模型。作为这项工作的一部分开发的所有数据、工具、指南、模型和其他材料都将公开提供。

关键词

引用

@article{arxiv.2403.01926,
  title  = {IndicVoices: Towards building an Inclusive Multilingual Speech Dataset for Indian Languages},
  author = {Tahir Javed and Janki Atul Nawale and Eldho Ittan George and Sakshi Joshi and Kaushal Santosh Bhogale and Deovrat Mehendale and Ishvinder Virender Sethi and Aparna Ananthanarayanan and Hafsah Faquih and Pratiti Palit and Sneha Ravishankar and Saranya Sukumaran and Tripura Panchagnula and Sunjay Murali and Kunal Sharad Gandhi and Ambujavalli R and Manickam K M and C Venkata Vaijayanthi and Krishnan Srinivasa Raghavan Karunganni and Pratyush Kumar and Mitesh M Khapra},
  journal= {arXiv preprint arXiv:2403.01926},
  year   = {2024}
}