WHAMR!:含噪与混响的单通道语音分离
声音
2020-02-17 v2 音频与语音处理
摘要
尽管在重叠语音信号分离方面已取得显著进展,但研究大多局限于干净、近无混响语音的混合,并不能代表许多真实场景。虽然 WHAM! 数据集向普遍使用的 wsj0-2mix 数据集引入了噪声,但其未包含混响,而混响通常存在于录音室之外的室内录音中。混响引起的频谱涂抹会导致基于深度学习的标准语音分离系统性能显著下降,这类系统依赖频谱结构与语音信号的稀疏性来分离声源。为此,我们引入 WHAMR!,即带有合成混响源的 WHAM! 增强版本,并对当前技术以及在新引入条件下新颖的级联架构提供了详尽的基线分析。
引用
@article{arxiv.1910.10279,
title = {WHAMR!: Noisy and Reverberant Single-Channel Speech Separation},
author = {Matthew Maciejewski and Gordon Wichern and Emmett McQuinn and Jonathan Le Roux},
journal= {arXiv preprint arXiv:1910.10279},
year = {2020}
}
备注
Accepted for publication at ICASSP 2020