中文

用于多通道语音增强的带时序卷积的实时流式Wave-U-Net

信号处理 2021-04-06 v1 声音 音频与语音处理

摘要

在本文中,我们描述了为参加ConferencingSpeech2021挑战赛Task1所做的工作。该任务设定了以实时方式开发多通道语音增强解决方案的目标。我们提出了一种用于流式语音增强的新颖系统。我们在编码器和解码器中采用带时序卷积的Wave-U-Net架构。我们在解码器中引入自注意力,以将来自跳跃连接得到的注意力掩码应用于下采样块的特征。我们探索了历史缓存机制,其工作方式类似于循环网络中的隐藏状态,并在提案解决方案中实现。它帮助我们以40ms分块长度和0.4的实时因子(Real-Time Factor)进行推理且保持相同精度。

关键词

引用

@article{arxiv.2104.01923,
  title  = {Real-time Streaming Wave-U-Net with Temporal Convolutions for Multichannel Speech Enhancement},
  author = {Vasiliy Kuzmin and Fyodor Kravchenko and Artem Sokolov and Jie Geng},
  journal= {arXiv preprint arXiv:2104.01923},
  year   = {2021}
}

备注

Draft paper for InterSpeech 2021 processing