探索低延迟语音增强模型中的权衡
声音
2018-11-20 v1 音频与语音处理
摘要
我们探索了多种用于单通道与双通道基于谱图掩码的语音增强的神经网络配置。我们的最佳模型在 CHiME2 语音增强任务上以信号失真比(SDR)提升 0.4 分贝的成绩超越了先前的最先进性能。我们考察了诸如非因果前瞻、计算量与参数量相对于增强性能等权衡,发现零前瞻模型平均可达到距我们最佳双向模型 0.03 dB SDR 以内的性能。此外,我们发现 200 毫秒的前瞻足以达到与我们最佳双向模型相当的性能。
引用
@article{arxiv.1811.07030,
title = {Exploring Tradeoffs in Models for Low-latency Speech Enhancement},
author = {Kevin Wilson and Michael Chinen and Jeremy Thorpe and Brian Patton and John Hershey and Rif A. Saurous and Jan Skoglund and Richard F. Lyon},
journal= {arXiv preprint arXiv:1811.07030},
year = {2018}
}