注意力机制在语音分离中的全部作用
音频与语音处理
2021-03-10 v2 机器学习
声音
信号处理
摘要
循环神经网络(RNNs)长期以来一直是序列到序列学习的主导架构。然而,RNNs 本质上是顺序模型,不允许其计算并行化。Transformers 正作为标准 RNNs 的自然替代方案出现,以多头注意力机制取代循环计算。在本文中,我们提出 SepFormer,一种新颖的基于 Transformer 且无 RNN 的语音分离神经网络。SepFormer 采用使用 Transformer 的多尺度方法学习短期与长期依赖。所提模型在标准 WSJ0-2/3mix 数据集上达到了最先进(SOTA)性能。它在 WSJ0-2mix 上达到 22.3 dB 的 SI-SNRi,在 WSJ0-3mix 上达到 19.5 dB 的 SI-SNRi。SepFormer 继承了 Transformers 的并行化优势,即使将编码表征下采样 8 倍仍取得有竞争力的性能。因此,它比具有可比性能的最新语音分离系统显著更快且内存需求更低。
引用
@article{arxiv.2010.13154,
title = {Attention is All You Need in Speech Separation},
author = {Cem Subakan and Mirco Ravanelli and Samuele Cornell and Mirko Bronzi and Jianyuan Zhong},
journal= {arXiv preprint arXiv:2010.13154},
year = {2021}
}
备注
Accepted to ICASSP 2021