公开可用数据的语音增强是否有助于构建鲁棒语音识别系统?
音频与语音处理
2019-11-21 v2 计算与语言
声音
摘要
自动语音识别(ASR)系统在包括语音助手在内的许多商业产品中起着关键作用。通常,它们需要大量干净语音数据进行训练,这使拥有海量私有数据的大型组织获得了不当优势。在本文中,我们首先利用公开可用数据源整理了一个相当大的数据集。此后,我们尝试探究能否使用公开可用的含噪数据来训练鲁棒ASR系统。我们先用语音增强清理含噪数据,再将其与清理后的版本一同用于训练ASR系统。我们发现,使用语音增强相比仅在含噪数据上训练词错率降低9.5%,相比仅在干净数据上训练降低9%。其性能也与在含噪数据及其干净版本上训练的理想情形相当。
引用
@article{arxiv.1910.13488,
title = {Does Speech enhancement of publicly available data help build robust Speech Recognition Systems?},
author = {Bhavya Ghai and Buvana Ramanan and Klaus Mueller},
journal= {arXiv preprint arXiv:1910.13488},
year = {2019}
}
备注
Accepted to AAAI conference of Artificial Intelligence 2020 (abstract)