TF-Locoformer:基于卷积进行局部建模的Transformer用于语音分离与增强
音频与语音处理
2024-08-08 v1 声音
摘要
时频(TF)域双路径模型实现了高保真语音分离。虽然一些先前最先进的模型依赖RNN,但这意味着它们缺乏Transformer模块所具有的并行性、可扩展性和通用性。鉴于纯Transformer架构在其他领域的广泛成功,本工作专注于从TF域双路径模型中移除RNN,同时保持最先进的性能。本工作提出了TF-Locoformer,一种基于Transformer的模型,通过卷积进行局部建模(LOcal-modeling by COnvolution)。该模型使用带有卷积层的前馈网络(FFN)替代线性层来捕获局部信息,使自注意力专注于捕获全局模式。我们在自注意力前后各放置两个这样的FFN以增强局部建模能力。我们还为TF域双路径模型引入了一种新颖的归一化方法。在分离和增强数据集上的实验表明,所提出的模型在多个基准上达到或超越了最先进的性能,且采用无RNN架构。
引用
@article{arxiv.2408.03440,
title = {TF-Locoformer: Transformer with Local Modeling by Convolution for Speech Separation and Enhancement},
author = {Kohei Saijo and Gordon Wichern and François G. Germain and Zexu Pan and Jonathan Le Roux},
journal= {arXiv preprint arXiv:2408.03440},
year = {2024}
}
备注
Accepted to IWAENC 2024