在一种卷积网络变体中以双路径策略嵌入循环层用于说话人无关的语音分离
音频与语音处理
2022-06-17 v2 声音
摘要
随着深度神经网络(DNN)的发展,说话人无关的语音分离近年来取得了显著性能。从传统的卷积神经网络(CNN)和循环神经网络(RNN)到先进的 transformer,各种网络架构被精巧地设计以提升分离性能。然而,最先进的模型通常存在若干与计算相关的缺陷,如模型尺寸大、内存消耗高和计算复杂。为在性能与计算效率间取得平衡,并进一步探索传统网络结构的建模能力,我们结合 RNN 与一种新提出的卷积网络变体来处理语音分离问题。借助双路径策略将两个 RNN 嵌入该变体的基本块中,所提网络能有效学习局部信息与全局依赖。此外,四阶段结构使分离过程能随着特征维度增加而逐渐在越来越精细的尺度上执行。在各数据集上的实验结果证明了所提方法的有效性,并表明在分离性能与计算效率间实现了良好折中。
引用
@article{arxiv.2203.13574,
title = {Embedding Recurrent Layers with Dual-Path Strategy in a Variant of Convolutional Network for Speaker-Independent Speech Separation},
author = {Xue Yang and Changchun Bao},
journal= {arXiv preprint arXiv:2203.13574},
year = {2022}
}
备注
Accepted by Interspeech 2022