TED-LIUM 3:数据量翻倍及用于说话人自适应实验的语料库划分
计算与语言
2019-06-14 v4
摘要
在本文中,我们发布了专用于英语语音识别的 TED-LIUM 3 语料库,与 TED-LIUM 2 相比,用于训练声学模型的可用数据量增加了一倍多。我们介绍了自动语音识别(ASR)系统的最新进展,并与 2012 年和 2014 年发布的两个先前版本的 TED-LIUM 语料库进行了比较。我们证明,将转录语音训练数据从 207 小时增加到 452 小时,对端到端 ASR 系统的增益远大于对基于 HMM 的 SOTA 系统,尽管在音频训练数据量为 452 小时时,基于 HMM 的 ASR 系统仍然优于端到端 ASR 系统,其词错率(WER)分别为 6.6% 和 13.7%。最后,我们提出了 TED-LIUM 3 语料库的两种划分方式:一种是遗留划分,与版本 2 中的现有划分相同;另一种是新的划分,经过校准和设计以用于进行说话人自适应实验。与前两个版本一样,TED-LIUM 3 语料库将免费提供给研究社区。
引用
@article{arxiv.1805.04699,
title = {TED-LIUM 3: twice as much data and corpus repartition for experiments on speaker adaptation},
author = {François Hernandez and Vincent Nguyen and Sahar Ghannay and Natalia Tomashenko and Yannick Estève},
journal= {arXiv preprint arXiv:1805.04699},
year = {2019}
}
备注
Submitted to SPECOM 2018, 20th International Conference on Speech and Computer; TED-LIUM 3 corpus available on https://lium.univ-lemans.fr/en/ted-lium3/