VoiceFilter:基于说话人条件谱图掩码的目标语音分离
音频与语音处理
2019-06-20 v6 机器学习
信号处理
机器学习
摘要
本文提出一种新颖系统,利用来自目标说话人的参考信号,将目标说话人的语音从多说话人信号中分离出来。我们通过训练两个独立的神经网络实现: (1) 一个产生说话人判别性嵌入的说话人识别网络;(2) 一个以含噪谱图和说话人嵌入为输入并生成掩码的谱图掩码网络。我们的系统显著降低了多说话人信号上的语音识别词错率(WER),且在单说话人信号上词错率退化极小。
引用
@article{arxiv.1810.04826,
title = {VoiceFilter: Targeted Voice Separation by Speaker-Conditioned Spectrogram Masking},
author = {Quan Wang and Hannah Muckenhirn and Kevin Wilson and Prashant Sridhar and Zelin Wu and John Hershey and Rif A. Saurous and Ron J. Weiss and Ye Jia and Ignacio Lopez Moreno},
journal= {arXiv preprint arXiv:1810.04826},
year = {2019}
}
备注
To appear in Interspeech 2019