用于评估和调优德语大词汇量连续语音识别系统的广播新闻语料库
计算与语言
2014-12-16 v1 声音
摘要
广播新闻的转录是大词汇量连续语音识别(LVCSR)的一个有趣且具有挑战性的应用。我们详细介绍了包含超过160小时德语广播新闻的手动分割和标注语料库的结构,并提议将其作为LVCSR系统的评估框架。我们展示了在该语料库上使用最先进的LVCSR解码器获得的实验结果,测量了不同特征集和解码参数的影响,从而证明了在台式PC上以9.2%的词错误率实时解码我们的测试集是可行的。
引用
@article{arxiv.1412.4616,
title = {A Broadcast News Corpus for Evaluation and Tuning of German LVCSR Systems},
author = {Felix Weninger and Björn Schuller and Florian Eyben and Martin Wöllmer and Gerhard Rigoll},
journal= {arXiv preprint arXiv:1412.4616},
year = {2014}
}
备注
submitted to INTERSPEECH 2010 on May 3, 2010