面向噪声与混响环境下实时单通道语音分离
音频与语音处理
2023-04-18 v2 声音
摘要
实时单通道语音分离旨在将从单个麦克风捕获的、同时包含多人说话、环境噪声与混响的音频流,分离为多条去混响且无噪声的语音轨,每条轨仅含一名说话人。尽管大型最先进 DNN 能从无混响语音混合中取得优异分离效果,主要挑战在于构建紧凑且因果的模型,能在推理时分离混响混合。本文探索用于两人或多人同时说话实时分离的低复杂度、资源高效、因果 DNN 架构。级联的三个神经网络模块被训练以依次执行噪声抑制、分离与去混响。作为对比,一个更大的端到端模型被训练为直接从含噪混响语音混合中输出两路无混响语音信号。我们提出一种带减式分离的高效单解码器架构,用于两人或多人说话人的实时递归语音分离。在真实单声道语音混合录音上的评估,依据 SI-SDR 等语音分离指标、DNS-MOS 等感知指标以及一种新提出的信道分离度量,表明这些紧凑因果模型能以低延迟分离语音混合,并与 SepFormer 等大型离线最先进模型表现相当。
引用
@article{arxiv.2303.07569,
title = {Towards Real-Time Single-Channel Speech Separation in Noisy and Reverberant Environments},
author = {Julian Neri and Sebastian Braun},
journal= {arXiv preprint arXiv:2303.07569},
year = {2023}
}
备注
to appear in ICASSP 2023