中文

QASR: QCRI Aljazeera 语音资源——大规模标注阿拉伯语语音语料库

计算与语言 2021-06-25 v1 声音 音频与语音处理

摘要

我们介绍了规模最大的已转写阿拉伯语语音语料库 QASR,采集自广播领域。该多方言语音数据集包含从 Aljazeera 新闻频道爬取的 2000 小时、16kHz 采样的语音。该数据集随轻监督转写文本一同发布,并与音频片段对齐。与以往数据集不同,QASR 包含基于语言学的切分、标点、说话人信息等内容。QASR 适用于训练和评估语音识别系统、基于声学及/或语言学的阿拉伯语方言识别、标点恢复、说话人识别、说话人关联,以及潜在的其他面向口语数据的 NLP 模块。除 QASR 转写文本外,我们还发布了一个含 1.3 亿词的数据集,以辅助设计和训练更优的语言模型。我们表明,在 QASR 上训练的端到端自动语音识别相比此前的 MGB-2 语料库取得了有竞争力的词错误率。我们给出了下游自然语言处理任务(如利用语音转写文本进行命名实体识别)的基线结果。我们还给出了阿拉伯语标点恢复的首个基线。我们向研究界公开该语料库。

关键词

引用

@article{arxiv.2106.13000,
  title  = {QASR: QCRI Aljazeera Speech Resource -- A Large Scale Annotated Arabic Speech Corpus},
  author = {Hamdy Mubarak and Amir Hussein and Shammur Absar Chowdhury and Ahmed Ali},
  journal= {arXiv preprint arXiv:2106.13000},
  year   = {2021}
}

备注

Speech Corpus, Spoken Conversation, ASR, Dialect Identification, Punctuation Restoration, Speaker Verification, NER, Named Entity, Arabic, Speaker gender, Turn-taking Accepted in ACL 2021