面向德语的开源自动语音识别
计算与语言
2018-07-30 v1
摘要
高质量的自动语音识别(ASR)是基于语音的应用与研究的先决条件。虽然最先进的ASR软件可自由获取,但由于可自由获取的训炼数据有限,除英语外其他语言的依赖语言的声学模型仍然缺乏。我们使用Kaldi在两个均基于知识共享(Creative Commons)许可证分发的数据集上训练德语声学模型。所得模型可自由再分发,降低了德语ASR的进入成本。模型在总计412小时德语朗读语音数据上训练,通过将Spoken Wikipedia Corpus的数据添加到先前最佳的自由可用德语声学模型配方与数据集,我们实现了26%的相对词错率降低。我们的最佳模型在Tuda-De测试集上达到14.38的词错率。由于训练数据中包含大量说话人及话题多样性,我们的模型对说话人变化与话题偏移具有鲁棒性。
引用
@article{arxiv.1807.10311,
title = {Open Source Automatic Speech Recognition for German},
author = {Benjamin Milde and Arne Köhn},
journal= {arXiv preprint arXiv:1807.10311},
year = {2018}
}
备注
Accepted at ITG 2018