中文

联合最优的降噪、去混响与源分离

音频与语音处理 2020-08-04 v3 声音

摘要

本文提出能够以计算高效的方式优化卷积波束形成器(CBF)从而联合执行降噪、去混响与源分离(DN+DR+SS)的方法。传统上,由加权预测误差最小化(WPE)去混响滤波器后接最小方差无失真响应波束形成器组成的级联配置已被用作远场语音识别的最先进前端,然而该方法的总体最优性无法保证。在盲信号处理领域,已提出一种联合优化去混响与源分离(DR+SS)的方法,但该方法需要巨大的计算成本,且尚未扩展应用于 DN+DR+SS。为克服上述局限,本文开发了以计算效率更高得多的方式联合优化 DN+DR+SS 的新方法。为此,我们首先基于最大似然估计给出一个优化 CBF 以执行 DN+DR+SS 的目标函数,假设目标信号的导向矢量给定或可估计,例如使用神经网络。本文将由此目标函数优化的 CBF 称为加权最小功率无失真响应(wMPDR)CBF。然后,我们基于将 CBF 分解为 WPE 滤波器与波束形成器的两种不同方式,推导出两种优化 wMPDR CBF 的算法。使用含噪混响声音混合物的实验表明,所提优化方法在信号失真度量和 ASR 性能方面相较传统级联配置大幅提升了语音增强性能。结果还表明,相较传统联合优化方法,所提方法在估计精度提升的同时大幅降低了计算成本。

关键词

引用

@article{arxiv.2005.09843,
  title  = {Jointly optimal denoising, dereverberation, and source separation},
  author = {Tomohiro Nakatani and Christoph Boeddeker and Keisuke Kinoshita and Rintaro Ikeshita and Marc Delcroix and Reinhold Haeb-Umbach},
  journal= {arXiv preprint arXiv:2005.09843},
  year   = {2020}
}

备注

Submitted to IEEE/ACM Trans. Audio, Speech, and Language Processing on 12 Feb 2020, Accepted to IEEE/ACM Trans. Audio, Speech, and Language Processing on 14 July 2020