中文

MossFormer:采用卷积增强联合自注意力门控单头 Transformer 推动单通道语音分离性能极限

声音 2023-02-24 v1 机器学习 音频与语音处理

摘要

基于 Transformer 的模型在单通道语音分离中带来了显著的性能提升。然而,与近期提出的上界相比仍存在性能差距。当前双路径 Transformer 模型的主要局限在于对长程元素交互与局部特征模式建模的低效。在本工作中,我们通过提出一种带有卷积增强联合自注意力的门控单头 Transformer 架构,即 \textit{MossFormer}(\textit{Mo}naural \textit{s}peech \textit{s}eparation Trans\textit{Former}),达到了该上界。为有效解决双路径架构中跨块间的间接元素交互问题,MossFormer 采用一种联合局部与全局自注意力架构,同时对局部块执行全计算自注意力,并对全序列执行线性化低代价自注意力。该联合注意力使 MossFormer 可直接建模全序列元素交互。此外,我们采用了一种带有简化单头自注意力的强力注意力门控机制。除注意力长程建模外,我们还以卷积增强 MossFormer 以进行位置级局部模式建模。因此,MossFormer 显著优于先前模型,并在 WSJ0-2/3mix 与 WHAM!/WHAMR! 基准上取得最先进结果。我们的模型在 WSJ0-3mix 上达到 21.2 dB 的 SI-SDRi 上界,在 WSJ0-2mix 上仅低于 23.1 dB 上界 0.3 dB。

关键词

引用

@article{arxiv.2302.11824,
  title  = {MossFormer: Pushing the Performance Limit of Monaural Speech Separation using Gated Single-Head Transformer with Convolution-Augmented Joint Self-Attentions},
  author = {Shengkui Zhao and Bin Ma},
  journal= {arXiv preprint arXiv:2302.11824},
  year   = {2023}
}

备注

5 pages, 3 figures, accepted by ICASSP 2023