中文

KT-Speech-Crawler:从 YouTube 视频自动构建语音识别数据集

计算与语言 2019-03-04 v1 机器学习 声音 音频与语音处理

摘要

本文描述了 KT-Speech-Crawler:一种通过爬取 YouTube 视频自动构建语音识别数据集的方法。我们概述了若干过滤与后处理步骤,以提取可用于训练端到端神经语音识别系统的样本。在实验中,我们展示了单核版本的爬虫可在一天内获取约150小时的转写语音,其转写词错误率估计为3.5%。自动收集的样本包含在不同条件下录制的朗读与自发语音,包括背景噪声与音乐、远距离麦克风录音,以及多种口音与混响。在训练深度神经网络进行语音识别时,我们将200小时收集样本加入训练集后,观察到 Wall Street Journal 数据集上的词错误率降低了约40%。演示(http://emnlp-demo.lakomkin.me/)与爬虫代码(https://github.com/EgorLakomkin/KTSpeechCrawler)均已公开可用。

关键词

引用

@article{arxiv.1903.00216,
  title  = {KT-Speech-Crawler: Automatic Dataset Construction for Speech Recognition from YouTube Videos},
  author = {Egor Lakomkin and Sven Magg and Cornelius Weber and Stefan Wermter},
  journal= {arXiv preprint arXiv:1903.00216},
  year   = {2019}
}

备注

Accepted at the Conference on Empirical Methods in Natural Language Processing 2018, Brussels, Belgium