中文

MediaSpeech:多语言 ASR 基准与数据集

音频与语音处理 2021-03-31 v1 声音

摘要

众所周知,自动语音识别(ASR)系统在不同应用领域的性能表现存在差异。与此同时,供应商和研究团队通常要么针对有限的简单领域(有声书、TED 演讲)报告 ASR 质量结果,要么基于专有数据集。为填补这一空白,我们提供了一个开源的 10 小时 ASR 系统评估数据集 NTR MediaSpeech,涵盖 4 种语言:西班牙语、法语、土耳其语和阿拉伯语。该数据集采集自相应语言的媒体官方 YouTube 频道,并经过人工转写。我们估计该数据集的词错率(WER)低于 5%。我们对商业和免费提供的众多 ASR 系统进行了基准测试,并给出基准结果。我们还开源了每种语言的 QuartzNet 基线模型。

关键词

引用

@article{arxiv.2103.16193,
  title  = {MediaSpeech: Multilanguage ASR Benchmark and Dataset},
  author = {Rostislav Kolobov and Olga Okhapkina and Olga Omelchishina and Andrey Platunov and Roman Bedyakin and Vyacheslav Moshkin and Dmitry Menshikov and Nikolay Mikhaylovskiy},
  journal= {arXiv preprint arXiv:2103.16193},
  year   = {2021}
}