复杂环境中的隐蔽语音(VOICES)语料库
声音
2018-05-17 v2 音频与语音处理
摘要
本文介绍了复杂环境中的隐蔽语音(VOICES)语料库,这是一个基于知识共享署名4.0协议(Creative Commons BY 4.0)的免费可用数据集。该数据集将促进对在嘈杂房间条件下由远场麦克风录制的语音进行语音和信号处理研究。公开可用的语音语料库大多由近距离麦克风录制的孤立语音组成。更好地表示真实场景的一种典型方法是将纯净语音与噪声和模拟房间响应进行卷积以用于模型训练。尽管做出了这些努力,当在自然条件下针对未经整理的语音进行测试时,模型性能会下降。对于本语料库,音频是在配有家具的房间内录制的,同时播放背景噪声以及从LibriSpeech语料库中选取的前景语音。在每个房间内记录了多个会话,以涵盖所有前景语音与背景噪声的组合。音频使用放置在房间各处的十二个麦克风录制,每个麦克风产生120小时的音频。这项工作是由SRI International和Lab41主导的多机构合作,旨在推动信号处理和语音识别中最先进的远距离麦克风方法。
引用
@article{arxiv.1804.05053,
title = {Voices Obscured in Complex Environmental Settings (VOICES) corpus},
author = {Colleen Richey and Maria A. Barrios and Zeb Armstrong and Chris Bartels and Horacio Franco and Martin Graciarena and Aaron Lawson and Mahesh Kumar Nandwana and Allen Stauffer and Julien van Hout and Paul Gamble and Jeff Hetherly and Cory Stephenson and Karl Ni},
journal= {arXiv preprint arXiv:1804.05053},
year = {2018}
}
备注
Submitted to Interspeech 2018