面向德语端到端语音识别的大规模语料CTC切分
音频与语音处理
2020-10-06 v2
摘要
近期端到端自动语音识别(ASR)系统已展现出超越传统混合DNN/HMM ASR的能力。除这些系统的架构改进外,其模型在深度、参数量与模型容量上也不断增长。然而,这些模型也需要更多训练数据以取得可比性能。本工作中,我们合并了自由获取的德语语音识别语料(含尚未标注的语音数据),构建了一个超过小时语音数据的大规模数据集。在数据准备方面,我们提出一种两阶段方法,利用以连接主义时序分类(CTC)预训练的ASR模型,从未切分或未标注的训练数据中引导出更多训练数据。然后从以CTC训练的网络所得标签概率中提取语句以确定切分对齐。利用该训练数据,我们训练了一个混合CTC/注意力Transformer模型,在Tuda-DE测试集上取得的WER,超越了传统混合DNN/HMM ASR先前的基线。
引用
@article{arxiv.2007.09127,
title = {CTC-Segmentation of Large Corpora for German End-to-end Speech Recognition},
author = {Ludwig Kürzinger and Dominik Winkelbauer and Lujun Li and Tobias Watzel and Gerhard Rigoll},
journal= {arXiv preprint arXiv:2007.09127},
year = {2020}
}
备注
Published at SPECOM 2020