X-TaSNet:鲁棒且准确的时间域说话人提取网络
音频与语音处理
2020-10-27 v1
摘要
基于目标说话人的参考语音从混合音频中提取该说话人的语音,是语音处理中一项具挑战性却强大的技术。近期关于说话人无关语音分离(如 TasNet)的研究,通过在时域波形上应用深度神经网络展示了有前景的结果。当指定目标说话人时,此类分离网络无法直接生成可靠且准确的输出,因为其对说话人数量有先验需求,且在处理缺失说话人的音频时缺乏鲁棒性。在本文中,我们通过引入一种称为 X-TaSNet 的新型说话人感知语音掩蔽方法打破了这些局限。我们的方案采用新策略,包括基于失真的损失及相应的交替训练方案,以更好地解决鲁棒性问题。X-TaSNet 显著提升了提取语音质量,将输出语音音频的 SDRi 和 SI-SNRi 提升至最先进语音滤波方法的两倍。X-TaSNet 还将输出音频中说话人身份的准确率提高到 95.4%,从而在目标说话人缺失时大多返回静音音频,提升了结果的可靠性。这些结果表明 X-TaSNet 向说话人提取技术更实际应用迈出了坚实一步。
引用
@article{arxiv.2010.12766,
title = {X-TaSNet: Robust and Accurate Time-Domain Speaker Extraction Network},
author = {Zining Zhang and Bingsheng He and Zhenjie Zhang},
journal= {arXiv preprint arXiv:2010.12766},
year = {2020}
}