基于盲源分离与数据增强训练的X-vector说话人选择的目标语音提取
音频与语音处理
2020-11-02 v2 信号处理
摘要
从混合语音中提取所需语音是一项有意义且具有挑战性的任务。基于端到端深度神经网络的方法虽然吸引人,但面临泛化问题。本文通过结合盲源分离(BSS)与基于x-vector的说话人识别(SR)模块,探索了一种用于目标语音提取的串行方法。利用并比较了两种基于源独立性假设的有前景的BSS方法:独立低秩矩阵分析(ILRMA)和多通道变分自编码器(MVAE)。ILRMA采用非负矩阵分解(NMF)来捕获源信号的频谱结构,而MVAE利用深度神经网络(DNN)的强大建模能力。然而,对MVAE的研究此前局限于使用极少说话人的训练,且测试说话人的语音信号通常包含在训练集中。我们使用500名说话人的干净语音信号扩展MVAE的训练,以评估其对未见说话人的泛化能力。为提高正确提取率,实施了两种数据增强策略来训练SR模块。所提出的级联方法的性能在由真实房间冲激响应于不同环境下构建的测试数据上进行了研究。
引用
@article{arxiv.2005.07976,
title = {Target Speech Extraction Based on Blind Source Separation and X-vector-based Speaker Selection Trained with Data Augmentation},
author = {Zhaoyi Gu and Lele Liao and Kai Chen and Jing Lu},
journal= {arXiv preprint arXiv:2005.07976},
year = {2020}
}
备注
5 pages, 2 figures, section 3-5 of the original submission are replaced with new experiments and conclusions