KT-Speech-Crawler:从 YouTube 视频自动构建语音识别数据集
计算与语言
2019-03-04 v1 机器学习
声音
音频与语音处理
摘要
本文描述了 KT-Speech-Crawler:一种通过爬取 YouTube 视频自动构建语音识别数据集的方法。我们概述了若干过滤与后处理步骤,以提取可用于训练端到端神经语音识别系统的样本。在实验中,我们展示了单核版本的爬虫可在一天内获取约150小时的转写语音,其转写词错误率估计为3.5%。自动收集的样本包含在不同条件下录制的朗读与自发语音,包括背景噪声与音乐、远距离麦克风录音,以及多种口音与混响。在训练深度神经网络进行语音识别时,我们将200小时收集样本加入训练集后,观察到 Wall Street Journal 数据集上的词错误率降低了约40%。演示(http://emnlp-demo.lakomkin.me/)与爬虫代码(https://github.com/EgorLakomkin/KTSpeechCrawler)均已公开可用。
引用
@article{arxiv.1903.00216,
title = {KT-Speech-Crawler: Automatic Dataset Construction for Speech Recognition from YouTube Videos},
author = {Egor Lakomkin and Sven Magg and Cornelius Weber and Stefan Wermter},
journal= {arXiv preprint arXiv:1903.00216},
year = {2019}
}
备注
Accepted at the Conference on Empirical Methods in Natural Language Processing 2018, Brussels, Belgium