中文

面向低资源印度语言的标注语音语料库:阿瓦德语、博杰普尔语、布拉杰语与马加希语

计算与语言 2022-07-25 v1 声音 音频与语音处理

摘要

本文讨论一项正在进行的工作:使用语言数据采集的田野方法,为四种低资源印度-雅利安语言——阿瓦德语、博杰普尔语、布拉杰语与马加希语——开发语音语料库。该语料库当前总规模约为 18 小时(每种语言约 4–5 小时),并已转写并标注了词性标签、形态特征和通用依存关系等语法信息。我们讨论了在这些语言中进行数据采集的方法,其中大部分工作是在 COVID-19 大流行中期完成的,其目的之一是为讲这些语言的低收入群体创造一些额外收入。文中我们还讨论了在这些语言上自动语音识别系统的基线实验结果。

关键词

引用

@article{arxiv.2206.12931,
  title  = {Annotated Speech Corpus for Low Resource Indian Languages: Awadhi, Bhojpuri, Braj and Magahi},
  author = {Ritesh Kumar and Siddharth Singh and Shyam Ratan and Mohit Raj and Sonal Sinha and Bornini Lahiri and Vivek Seshadri and Kalika Bali and Atul Kr. Ojha},
  journal= {arXiv preprint arXiv:2206.12931},
  year   = {2022}
}

备注

Speech for Social Good Workshop, 2022, Interspeech 2022