用于端到端单通道语音分离的多尺度特征融合 Transformer 网络
声音
2022-12-15 v1 音频与语音处理
摘要
近期关于时域音频分离网络(TasNet)的研究在语音分离方面取得了重大进展。最具代表性的 TasNet 之一是一种采用双路径分割方法的网络。然而,称为 DPRNN 的原始模型在整个网络的所有层中使用了固定的特征维度和不变的段大小。本文中,我们提出一种基于传统双路径结构的多尺度特征融合 Transformer 网络(MSFFT-Net),用于单通道语音分离。与传统双路径结构仅存在一条处理路径、采用多个迭代块以交替的块内和块间操作来捕获局部和全局上下文信息不同,所提出的 MSFFT-Net 具有多条并行处理路径,特征信息可在多条并行处理路径之间交换。实验表明,我们提出的基于多尺度特征融合结构的网络在基准数据集 WSJ0-2mix 上取得了优于原始双路径模型的结果,其中 MSFFT-3P 的 SI-SNRi 得分为 20.7dB(提升 1.47%),MSFFT-2P 为 21.0dB(提升 3.45%),在未使用任何数据增强方法的情况下达到了 WSJ0-2mix 上的 SOTA。
引用
@article{arxiv.2212.07163,
title = {Multi-Scale Feature Fusion Transformer Network for End-to-End Single Channel Speech Separation},
author = {Yinhao Xu and Jian Zhou and Liang Tao and Hon Keung Kwan},
journal= {arXiv preprint arXiv:2212.07163},
year = {2022}
}