FurcaNeXt:基于动态门控扩张时间卷积网络的端到端单通道语音分离
声音
2023-06-27 v6 音频与语音处理
摘要
深度扩张时间卷积网络(TCN)已被证明在序列建模中非常有效。本文针对端到端单通道语音分离方法提出了若干TCN的改进,包括:1)多尺度动态加权门控扩张卷积金字塔网络(FurcaPy),2)具有并行内卷积组件的门控TCN(FurcaPa),3)权重共享的多尺度门控TCN(FurcaSh),4)具有门控差分卷积组件的扩张TCN(FurcaSu);所有这些网络均接收两名说话人的混合语音并将其映射为两条分离语音,其中每条语音仅包含一名说话人的声音。在目标函数方面,我们提出以置换不变训练(PIT)方式直接优化语句级信号失真比(SDR)来训练网络。我们在公开WSJ0-2mix语料库上的实验取得了18.4dB的SDR提升,表明所提网络可提升说话人分离任务的性能。
引用
@article{arxiv.1902.04891,
title = {FurcaNeXt: End-to-end monaural speech separation with dynamic gated dilated temporal convolutional networks},
author = {Liwen Zhang and Ziqiang Shi and Jiqing Han and Anyan Shi and Ding Ma},
journal= {arXiv preprint arXiv:1902.04891},
year = {2023}
}
备注
Arxiv only allows figures with a small resolution. If you need to see large-resolution figures, please contact us. arXiv admin note: substantial text overlap with arXiv:1902.00651