资源高效分离 Transformer
音频与语音处理
2024-01-17 v2 机器学习
声音
信号处理
摘要
Transformer 最近在语音分离中取得了最先进的性能。然而,这些模型计算需求高,且需要大量可学习参数。本文探索了以降低计算成本的方式进行基于 Transformer 的语音分离。我们的主要贡献是开发了资源高效分离 Transformer (RE-SepFormer),这是一种基于自注意力的架构,通过两种方式减少计算负担。首先,它在潜在空间中使用非重叠块。其次,它对从每个块计算出的紧凑潜在摘要进行操作。RE-SepFormer 在流行的 WSJ0-2Mix 和 WHAM! 数据集上,在因果和非因果设置下均达到了有竞争力的性能。值得注意的是,它在内存和推理时间方面的扩展性显著优于之前的基于 Transformer 的架构,使其更适合处理长混合语音。
引用
@article{arxiv.2206.09507,
title = {Resource-Efficient Separation Transformer},
author = {Luca Della Libera and Cem Subakan and Mirco Ravanelli and Samuele Cornell and Frédéric Lepoutre and François Grondin},
journal= {arXiv preprint arXiv:2206.09507},
year = {2024}
}
备注
Accepted to ICASSP 2024