TRUNet:用于多通道混响声源分离的 Transformer-循环-U 网络
音频与语音处理
2022-08-23 v2 声音
信号处理
摘要
近年来,利用循环、卷积和 transformer 网络提出了许多用于单通道声源分离的深度学习方法。当有多个麦克风可用时,除谱-时域多样性外,还可利用说话人与背景噪声之间的空间分集,通过多通道滤波器进行声源分离。针对端到端多通道源分离,本文提出一种 transformer-循环-U 网络(TRUNet),其直接从多通道输入频谱估计多通道滤波器。TRUNet 由一个跨麦克风通道具有注意力机制以捕获空间分集的空间处理网络,以及一个旨在捕获谱和时域分集的谱-时域处理网络组成。除多通道滤波器外,我们也考虑使用 TRUNet 从多通道输入频谱估计单通道滤波器。我们在大型混响数据集上采用组合压缩均方误差损失函数训练该网络,进一步提升了声音分离性能。我们在由实际麦克风阵列测量的房间脉冲响应生成的真实且具挑战性的混响数据集上评估该网络。真实混响声源分离的实验结果表明,所提 TRUNet 优于最先进的单通道与多通道源分离方法。
引用
@article{arxiv.2110.04047,
title = {TRUNet: Transformer-Recurrent-U Network for Multi-channel Reverberant Sound Source Separation},
author = {Ali Aroudi and Stefan Uhlich and Marc Ferras Font},
journal= {arXiv preprint arXiv:2110.04047},
year = {2022}
}