MossFormer2:结合 Transformer 与无 RNN 循环网络以增强时域单声道语音分离
声音
2024-12-02 v2 音频与语音处理
摘要
我们先前提出的 MossFormer 在单声道语音分离中取得了令人瞩目的性能。然而,它主要采用基于自注意力的 MossFormer 模块,倾向于捕捉较长范围、较粗尺度的依赖关系,在有效建模较细尺度循环模式方面存在不足。在本文中,我们引入了一种新型混合模型,通过将循环模块集成到 MossFormer 框架中,提供了同时建模长程粗尺度依赖和细粒度循环模式的能力。我们不使用采用传统循环连接的循环神经网络(RNN),而是提出了一种基于前馈序列记忆网络(FSMN)的循环模块,由于其能够在不使用循环连接的情况下捕捉循环模式,因此被视为“无 RNN”循环网络。我们的循环模块主要包含一个通过门控卷积单元(GCU)和密集连接增强的膨胀 FSMN 块。此外,还添加了瓶颈层和输出层以控制信息流。该循环模块依赖线性投影和卷积,实现对整个序列的无缝并行处理。集成的 MossFormer2 混合模型相比 MossFormer 展现出显著的提升,并在 WSJ0-2/3mix、Libri2Mix 和 WHAM!/WHAMR! 基准测试中超越了其他 SOTA 方法 (https://github.com/modelscope/ClearerVoice-Studio)。
引用
@article{arxiv.2312.11825,
title = {MossFormer2: Combining Transformer and RNN-Free Recurrent Network for Enhanced Time-Domain Monaural Speech Separation},
author = {Shengkui Zhao and Yukun Ma and Chongjia Ni and Chong Zhang and Hao Wang and Trung Hieu Nguyen and Kun Zhou and Jiaqi Yip and Dianwen Ng and Bin Ma},
journal= {arXiv preprint arXiv:2312.11825},
year = {2024}
}
备注
5 pages, 3 figures, accepted by ICASSP 2024