双路径Transformer网络:面向端到端单通道语音分离的直接上下文感知建模
音频与语音处理
2020-08-17 v3 声音
摘要
主流的语音分离模型基于复杂的循环或卷积神经网络,其通过间接以上下文为条件来建模语音序列,例如通过循环神经网络中的许多中间状态传递信息,导致次优的分离性能。本文提出一种用于端到端语音分离的双路径Transformer网络(DPTNet),其在语音序列建模中引入直接上下文感知。通过引入改进的Transformer,语音序列中的元素可直接交互,使DPTNet能够以直接上下文感知对语音序列建模。我们所采用的改进Transformer通过将循环神经网络融入原始Transformer,无需位置编码即可学习语音序列的顺序信息。此外,双路径结构使我们的模型能高效建模极长语音序列。在基准数据集上的大量实验表明,我们的方法优于当前最优方法(在公开WSj0-2mix语料库上达到20.6 dB SDR)。
引用
@article{arxiv.2007.13975,
title = {Dual-Path Transformer Network: Direct Context-Aware Modeling for End-to-End Monaural Speech Separation},
author = {Jingjing Chen and Qirong Mao and Dong Liu},
journal= {arXiv preprint arXiv:2007.13975},
year = {2020}
}
备注
5 pages. Accepted by INTERSPEECH 2020