基于高阶潜域细粒度编码的逐步精炼语音分离网络
音频与语音处理
2022-02-01 v2 机器学习
声音
摘要
单通道语音分离的关键在于如何将混合信号编码进这样的潜嵌入空间,使不同说话人的信号可被精确分离。现有语音分离方法或将语音信号变换至频域进行分离,或基于卷积滤波器构建潜域以学习可分离嵌入空间。虽然后一类学习嵌入空间的方法取得了实质性改进,我们认为仅由单一潜域定义的嵌入空间不足以提供彻底可分离的语音分离编码空间。本文提出逐步精炼语音分离网络(SRSSN),其遵循由粗到精的分离框架。它首先在粗分离阶段学习一阶潜域以定义编码空间从而进行粗略分离。随后 SRSSN 在精炼阶段沿现有潜域的各基函数学习新潜域,获得高阶潜域,使模型能进行精炼分离以实现更精确的语音分离。我们通过在 WSJ0-2/3mix 数据集上的干净(无噪)环境以及 WHAM!/WHAMR! 数据集上的带噪/混响环境进行大量实验,证明了 SRSSN 的有效性。此外,我们还用本模型分离出的语音信号进行语音识别实验,以间接评估语音分离性能。
引用
@article{arxiv.2110.04791,
title = {Stepwise-Refining Speech Separation Network via Fine-Grained Encoding in High-order Latent Domain},
author = {Zengwei Yao and Wenjie Pei and Fanglin Chen and Guangming Lu and David Zhang},
journal= {arXiv preprint arXiv:2110.04791},
year = {2022}
}
备注
Accepted for publication in IEEE/ACM Transactions on Audio, Speech, and Language Processing (TASLP)