基于成对麦克风生成 DOA 掩码支持的 GEV 波束成形
音频与语音处理
2020-08-06 v2
摘要
远距离语音处理是一项具有挑战性的任务,尤其是在处理鸡尾酒会效应时。因此,通常在语音识别之前需要语音源分离作为预处理步骤,以改善信号失真比(SDR)。近来,已提出将波束成形与语音分离网络相结合,以在感兴趣到达方向上改善目标源质量。然而,此类方法中的神经网络需要针对特定麦克风阵列几何结构预先训练,这限制了在增删麦克风或改变阵列形状时的通用性。本文提出的解决方案是在具有不同间距和声学环境条件的成对麦克风上训练神经网络,然后使用该网络从构成任意形状阵列的所有成对麦克风估计时频掩码。利用该掩码,可估计目标与噪声协方差矩阵,进而用于执行广义特征值(GEV)波束成形。结果表明,对于对应于市售硬件的各种麦克风阵列几何结构,所提方法将 SDR 平均从 4.78 dB 提升至 7.69 dB。
引用
@article{arxiv.2005.09587,
title = {GEV Beamforming Supported by DOA-based Masks Generated on Pairs of Microphones},
author = {Francois Grondin and Jean-Samuel Lauzon and Jonathan Vincent and Francois Michaud},
journal= {arXiv preprint arXiv:2005.09587},
year = {2020}
}