AISHELL-2:将中文语音识别研究推向工业规模
计算与语言
2018-09-14 v2
摘要
AISHELL-1 是目前可用于中文语音识别研究的最大开源语音语料库。其发布时附带了一个基线系统,包含稳健的中文 ASR 训练与测试流程。在 AISHELL-2 中,我们发布了 1000 小时来自 iOS 的干净朗读语音数据,供学术用途免费使用。基于 AISHELL-2 语料库,我们开发并发布了一个改进方案,包含面向工业应用的关键组件,如中文分词、灵活词表扩展和音素集转换等。流程支持多种 SOTA 技术,如时延神经网络和无格 MMI 目标函数。此外,我们还发布了来自其他通道(Android 和 Mic)的开发与测试数据。对于研究界,我们希望 AISHELL-2 语料库能成为迁移学习和鲁棒 ASR 等课题的坚实资源。对于工业界,我们希望 AISHELL-2 方案能成为构建有意义的工业系统与产品的有益参考。
引用
@article{arxiv.1808.10583,
title = {AISHELL-2: Transforming Mandarin ASR Research Into Industrial Scale},
author = {Jiayu Du and Xingyu Na and Xuechen Liu and Hui Bu},
journal= {arXiv preprint arXiv:1808.10583},
year = {2018}
}