探索用于语音分离的自注意力机制
音频与语音处理
2023-05-30 v2 机器学习
声音
信号处理
摘要
Transformer在深度学习中实现了令人印象深刻的改进。它们在许多任务中常优于循环与卷积模型,同时利用并行处理的优势。近期,我们提出了SepFormer,其在WSJ0-2/3 Mix数据集上取得了语音分离的SOTA性能。本文深入研究用于语音分离的Transformer。特别地,我们通过给出在更具挑战性的含噪及含噪混响数据集(如LibriMix、WHAM!和WHAMR!)上的结果,扩展了先前关于SepFormer的发现。此外,我们将模型扩展至语音增强,并提供了去噪与去混响任务的实验证据。最后,我们首次在语音分离中探究了高效自注意力机制(如Linformer、Lonformer和ReFormer)的使用。我们发现它们显著降低了内存需求。例如,我们展示了基于Reformer的注意力在WSJ0-2Mix数据集上优于流行的Conv-TasNet模型,同时推理更快且内存消耗相当。
引用
@article{arxiv.2202.02884,
title = {Exploring Self-Attention Mechanisms for Speech Separation},
author = {Cem Subakan and Mirco Ravanelli and Samuele Cornell and Francois Grondin and Mirko Bronzi},
journal= {arXiv preprint arXiv:2202.02884},
year = {2023}
}
备注
Accepted to IEEE/ACM Transactions on Audio, Speech, and Language Processing