AmbiSep:基于 Transformer 网络的 Ambisonic 到 Ambisonic 混响语音分离
音频与语音处理
2022-06-14 v1 信号处理
摘要
考虑一段包含多个混响语音信号混合的多通道 Ambisonic 录音。从混合信号中盲检索对应于各个语音源的混响 Ambisonic 信号是一项具有挑战性的任务,因为它需要为每个源估计多个信号通道。在这项工作中,我们提出 AmbiSep,一种基于深度神经网络的平面波域掩码方法来解决该任务。掩码网络在三路径处理配置中使用学习到的特征表示和 transformers。我们在空间化的 WSJ0-2mix 数据集上训练和评估所提出的网络架构,并表明该方法在盲测试集上实现了 17.7 dB 的多通道尺度不变信号失真比提升,同时保留了分离声音的空间特性。
引用
@article{arxiv.2206.06184,
title = {AmbiSep: Ambisonic-to-Ambisonic Reverberant Speech Separation Using Transformer Networks},
author = {Adrian Herzog and Srikanth Raj Chetupalli and Emanuël A. P. Habets},
journal= {arXiv preprint arXiv:2206.06184},
year = {2022}
}
备注
Preprint submitted to IWAENC 2022 (https://iwaenc2022.org)