用于多通道语音增强的带时序卷积的实时流式Wave-U-Net
信号处理
2021-04-06 v1 声音
音频与语音处理
摘要
在本文中,我们描述了为参加ConferencingSpeech2021挑战赛Task1所做的工作。该任务设定了以实时方式开发多通道语音增强解决方案的目标。我们提出了一种用于流式语音增强的新颖系统。我们在编码器和解码器中采用带时序卷积的Wave-U-Net架构。我们在解码器中引入自注意力,以将来自跳跃连接得到的注意力掩码应用于下采样块的特征。我们探索了历史缓存机制,其工作方式类似于循环网络中的隐藏状态,并在提案解决方案中实现。它帮助我们以40ms分块长度和0.4的实时因子(Real-Time Factor)进行推理且保持相同精度。
引用
@article{arxiv.2104.01923,
title = {Real-time Streaming Wave-U-Net with Temporal Convolutions for Multichannel Speech Enhancement},
author = {Vasiliy Kuzmin and Fyodor Kravchenko and Artem Sokolov and Jie Geng},
journal= {arXiv preprint arXiv:2104.01923},
year = {2021}
}
备注
Draft paper for InterSpeech 2021 processing