基于空间线索的单源伪双耳去混响中波束形成效应的保持
音频与语音处理
2022-08-11 v1 声音
摘要
混响在封闭空间中不可避免,导致听力受损者、非母语听者乃至噪声环境下正常听力者的可懂度下降,并降低机器听觉应用的性能。本文提出一种单语音源双耳去混响新方法,利用直达路径信号与混响信号在双耳线索上的差异。两个相距为双耳间距的波束形成器用于从混响语音中提取混响。这些混响产生的双耳线索与直达路径信号产生的双耳线索构成两类数据集,用于训练 U-Net(一种深度卷积神经网络)。训练后移除波束形成器,将训练好的 U-Net 与最大似然估计(MLE)算法用于区分系统暴露于混响语音信号双耳谱图时的直达路径线索与混响线索。所提模型在倒谱距离(CEP)、频率加权分段信噪比(FWSEGSNR)和信混比调制能量比(SRMR)上分别优于经典信号处理去混响模型加权预测误差 1.4 点、8 dB 和 0.6 dB;其训练数据集几乎仅为该深度学习去混响模型所需数据的 1/8,且在 CEP 上提升 1.3 点、FWSEGSNR 相当的情况下取得了更优性能。该模型在相对相似的未见声学条件及训练位置附近也保持了性能。
引用
@article{arxiv.2208.05184,
title = {Preserving the beamforming effect for spatial cue-based pseudo-binaural dereverberation of a single source},
author = {Sania Gul and Muhammad Salman Khan and Syed Waqar Shah},
journal= {arXiv preprint arXiv:2208.05184},
year = {2022}
}
备注
25 pages, 7 figures