中文

用于评估和调优德语大词汇量连续语音识别系统的广播新闻语料库

计算与语言 2014-12-16 v1 声音

摘要

广播新闻的转录是大词汇量连续语音识别(LVCSR)的一个有趣且具有挑战性的应用。我们详细介绍了包含超过160小时德语广播新闻的手动分割和标注语料库的结构,并提议将其作为LVCSR系统的评估框架。我们展示了在该语料库上使用最先进的LVCSR解码器获得的实验结果,测量了不同特征集和解码参数的影响,从而证明了在台式PC上以9.2%的词错误率实时解码我们的测试集是可行的。

关键词

引用

@article{arxiv.1412.4616,
  title  = {A Broadcast News Corpus for Evaluation and Tuning of German LVCSR Systems},
  author = {Felix Weninger and Björn Schuller and Florian Eyben and Martin Wöllmer and Gerhard Rigoll},
  journal= {arXiv preprint arXiv:1412.4616},
  year   = {2014}
}

备注

submitted to INTERSPEECH 2010 on May 3, 2010