探索生成对抗网络用于语音增强以提升鲁棒语音识别
声音
2018-11-01 v2 机器学习
神经与进化计算
音频与语音处理
摘要
我们研究了在提升自动语音识别(ASR)系统噪声鲁棒性的背景下,生成对抗网络(GANs)用于语音增强的有效性。先前工作表明 GANs 能有效抑制原始波形语音信号中的加性噪声,改善感知质量指标;然而该技术未在 ASR 背景下得到验证。本工作中,我们开展详细研究以衡量 GANs 在增强受加性与混响噪声污染的语音时的有效性。受图像处理近期进展启发,我们提出在 log-Mel 滤波器组谱而非波形上运行 GANs,其计算量更小且对混响噪声更鲁棒。尽管 GAN 增强改善了干净训练的 ASR 系统在噪声语音上的表现,但仍未及常规多风格训练(MTR)所达性能。通过将 GAN 增强特征附加至噪声输入并重新训练,我们相对 MTR 系统取得了 7% 的 WER 提升。
引用
@article{arxiv.1711.05747,
title = {Exploring Speech Enhancement with Generative Adversarial Networks for Robust Speech Recognition},
author = {Chris Donahue and Bo Li and Rohit Prabhavalkar},
journal= {arXiv preprint arXiv:1711.05747},
year = {2018}
}
备注
Published as a conference paper at ICASSP 2018