面向多通道窄带深度语音增强的麦克风阵列泛化
音频与语音处理
2021-07-28 v1 声音
摘要
本文研究基于深度学习的端到端多通道语音增强中的麦克风阵列泛化问题。我们旨在训练一个潜在地在未见过麦克风阵列上表现良好的唯一深度神经网络(DNN)。当在固定麦克风阵列上训练时,麦克风阵列几何形状塑造了网络参数,从而限制了训练网络向另一麦克风阵列的泛化。为解决该问题,使用由不同几何形状的各种麦克风阵列记录的数据来训练单一网络。我们设计了最近提出的窄带网络的三种变体,以应对麦克风数量未知的情况。总体而言,目标是使网络学习可用于任意阵列几何的语音增强通用信息,而非学习专用于单一阵列的特性。在模拟与真实房间脉冲响应(RIR)上的实验表明,所提网络具有优异的跨阵列泛化能力,其性能度量非常接近甚至超过使用测试阵列训练的网络。此外,它们显著优于各种波束成形方法及其他先进的基于深度学习的方法。
引用
@article{arxiv.2107.12601,
title = {Microphone Array Generalization for Multichannel Narrowband Deep Speech Enhancement},
author = {Siyuan Zhang and Xiaofei Li},
journal= {arXiv preprint arXiv:2107.12601},
year = {2021}
}
备注
Submitted to Interspeech Conference 2021