Speakerfilter-Pro:结合时域与频域的改进型目标说话人提取器
声音
2020-10-27 v1 机器学习
音频与语音处理
摘要
本文介绍一种基于我们先前Speakerfilter模型的改进型目标说话人提取器,称为Speakerfilter-Pro。Speakerfilter使用双向门控循环单元(BGRU)模块从锚语音刻画目标说话人,并使用卷积循环网络(CRN)模块从含噪信号分离目标语音。与Speakerfilter不同,Speakerfilter-Pro在首尾分别嵌入WaveUNet模块。WaveUNet已被证明在时域执行语音分离能力更优。为更好提取目标说话人信息,CRN模块的输入特征采用复数谱而非幅度谱。实验在广泛用于说话人提取的双说话人数据集(WSJ0-mix2)上进行。系统评估显示Speakerfilter-Pro优于Speakerfilter及其他基线,并取得14.95 dB的信畸比(SDR)。
引用
@article{arxiv.2010.13053,
title = {Speakerfilter-Pro: an improved target speaker extractor combines the time domain and frequency domain},
author = {Shulin He and Hao Li and Xueliang Zhang},
journal= {arXiv preprint arXiv:2010.13053},
year = {2020}
}
备注
Preprint, submitted to ICASSP 2021