中文

资源高效分离 Transformer

音频与语音处理 2024-01-17 v2 机器学习 声音 信号处理

摘要

Transformer 最近在语音分离中取得了最先进的性能。然而,这些模型计算需求高,且需要大量可学习参数。本文探索了以降低计算成本的方式进行基于 Transformer 的语音分离。我们的主要贡献是开发了资源高效分离 Transformer (RE-SepFormer),这是一种基于自注意力的架构,通过两种方式减少计算负担。首先,它在潜在空间中使用非重叠块。其次,它对从每个块计算出的紧凑潜在摘要进行操作。RE-SepFormer 在流行的 WSJ0-2Mix 和 WHAM! 数据集上,在因果和非因果设置下均达到了有竞争力的性能。值得注意的是,它在内存和推理时间方面的扩展性显著优于之前的基于 Transformer 的架构,使其更适合处理长混合语音。

关键词

引用

@article{arxiv.2206.09507,
  title  = {Resource-Efficient Separation Transformer},
  author = {Luca Della Libera and Cem Subakan and Mirco Ravanelli and Samuele Cornell and Frédéric Lepoutre and François Grondin},
  journal= {arXiv preprint arXiv:2206.09507},
  year   = {2024}
}

备注

Accepted to ICASSP 2024