中文

噪声和混响环境下的单麦克风说话人分离与语音活动检测

音频与语音处理 2024-01-09 v1 声音

摘要

语音分离涉及从多说话人音频信号中提取单个说话人的声音。现实环境中多个说话人可能同时交谈,其日益增加的复杂性凸显了有效语音分离技术的重要性。本文提出了一种面向噪声和混响环境的、具有时频注意力的单麦克风说话人分离网络。我们将这种新架构命名为分离时频注意力网络(Sep-TFAnet)。此外,我们提出了该分离网络的一个变体,称为Sep-TFAnetVAD \text{Sep-TFAnet}^{\text{VAD}},它将语音活动检测器(VAD)集成到分离网络中。分离模块基于受Conv-Tasnet架构启发的时序卷积网络(TCN)主干,并进行了多项修改。我们使用短时傅里叶变换(STFT)和逆短时傅里叶变换(iSTFT)分别进行分析和合成,而非使用学习型编码器和解码器。我们的系统专为人机交互开发,并应支持在线模式。在多种声学条件下对Sep-TFAnetVAD \text{Sep-TFAnet}^{\text{VAD}}和Sep-TFAnet的分离能力进行了评估和广泛分析,证明了它们相对于竞争方法的优势。由于在模拟数据上训练的分离网络在真实录音上往往表现不佳,我们还展示了所提方案能够更好地泛化到由人形机器人在我们声学实验室中录制的真实示例。项目页面:https://Sep-TFAnet.github.io

关键词

引用

@article{arxiv.2401.03448,
  title  = {Single-Microphone Speaker Separation and Voice Activity Detection in Noisy and Reverberant Environments},
  author = {Renana Opochinsky and Mordehay Moradi and Sharon Gannot},
  journal= {arXiv preprint arXiv:2401.03448},
  year   = {2024}
}