WPD++:一种用于同步语音分离与去混响的改进型神经波束成形器
音频与语音处理
2020-11-19 v1 声音
摘要
本文旨在从含噪多说话人语音混合信号中消除干扰说话人语音、加性噪声与混响,以惠及后端自动语音识别(ASR)。尽管近期提出的加权功率最小化无失真响应(WPD)波束成形器可同步进行分离与去混响,其噪声消除部分仍有提升空间。我们通过在传统 WPD 中增强波束成形模块以及采用多目标损失函数进行联合训练,提出了一种称为“WPD++”的改进型神经 WPD 波束成形器。该波束成形模块利用时空相关性得以改进。我们恰当设计了包含复谱域尺度不变信噪比(C-Si-SNR)与幅度域均方误差(Mag-MSE)的多目标损失,以对增强语音与干燥干净信号期望功率施加多重约束。联合训练以端到端方式优化复值掩码估计器与 WPD++ 波束成形器。结果表明,所提 WPD++ 在增强语音质量与 ASR 词错误率(WER)上优于若干最先进波束成形器。
引用
@article{arxiv.2011.09162,
title = {WPD++: An Improved Neural Beamformer for Simultaneous Speech Separation and Dereverberation},
author = {Zhaoheng Ni and Yong Xu and Meng Yu and Bo Wu and Shixiong Zhang and Dong Yu and Michael I Mandel},
journal= {arXiv preprint arXiv:2011.09162},
year = {2020}
}
备注
accepted by SLT 2021