语音分离的综合性研究:谱图分离与波形分离之比较
声音
2019-07-25 v2 机器学习
音频与语音处理
摘要
过去几年中,针对单通道近讲麦克风录音的语音分离已被广泛研究;所提出的解决方案多位于频域。近来,一种原始音频波形分离网络(TasNet)被引入用于单通道数据,相较于频域最优方案取得了更高的 Si-SNR(尺度不变源噪比)与 SDR(源失真比)。在本研究中,我们将 TasNet 的有效组件融入频域分离方法,并对二者在多种场景下进行对比。我们提出了一种在频域网络中直接优化分离准则的方案。除语音分离的客观与主观度量外,我们还在语音识别任务上评估了分离性能。我们研究了远场数据(更近似于自然音频流)的语音分离问题,并利用频谱、空间与说话人位置信息为频域与时域分离器开发了多通道方案。实验中,我们仿真了多通道空间化混响 WSJ0-2mix 数据集。实验结果表明,借助更优的网络设计,谱图分离可取得具竞争力的性能。多通道框架亦被证明能相对提升单通道性能,在 WER 与 SDR 上分别最高达 +35.5% 与 +46%。
引用
@article{arxiv.1905.07497,
title = {A comprehensive study of speech separation: spectrogram vs waveform separation},
author = {Fahimeh Bahmaninezhad and Jian Wu and Rongzhi Gu and Shi-Xiong Zhang and Yong Xu and Meng Yu and Dong Yu},
journal= {arXiv preprint arXiv:1905.07497},
year = {2019}
}
备注
INTERSPEECH 2019