中文

AISHELL-2:将中文语音识别研究推向工业规模

计算与语言 2018-09-14 v2

摘要

AISHELL-1 是目前可用于中文语音识别研究的最大开源语音语料库。其发布时附带了一个基线系统,包含稳健的中文 ASR 训练与测试流程。在 AISHELL-2 中,我们发布了 1000 小时来自 iOS 的干净朗读语音数据,供学术用途免费使用。基于 AISHELL-2 语料库,我们开发并发布了一个改进方案,包含面向工业应用的关键组件,如中文分词、灵活词表扩展和音素集转换等。流程支持多种 SOTA 技术,如时延神经网络和无格 MMI 目标函数。此外,我们还发布了来自其他通道(Android 和 Mic)的开发与测试数据。对于研究界,我们希望 AISHELL-2 语料库能成为迁移学习和鲁棒 ASR 等课题的坚实资源。对于工业界,我们希望 AISHELL-2 方案能成为构建有意义的工业系统与产品的有益参考。

关键词

引用

@article{arxiv.1808.10583,
  title  = {AISHELL-2: Transforming Mandarin ASR Research Into Industrial Scale},
  author = {Jiayu Du and Xingyu Na and Xuechen Liu and Hui Bu},
  journal= {arXiv preprint arXiv:1808.10583},
  year   = {2018}
}