中文

基于联合去混响与波束形成的端到端远场语音识别

音频与语音处理 2021-11-18 v2 声音

摘要

尽管端到端方法在多通道语音识别中已有成功应用,当语音被混响污染时性能仍严重退化。本文中,我们将去混响模块集成到端到端多通道语音识别系统中,并探索两种不同的前端架构。首先,基于多源掩码的加权预测误差(WPE)模块被纳入前端以去混响。其次,提出另一种新颖的前端架构,其将加权功率最小化无失真响应(WPD)卷积波束形成器扩展以执行同时分离与去混响。我们从原始 WPD 推导出新公式,可处理多源输入,并用矩阵求逆运算替代特征值分解以使反向传播算法更稳定。上述两种架构均以完全端到端方式优化,仅使用语音识别准则。在空间化的 wsj1-2mix 语料库与 REVERB 上的实验表明,我们提出的模型在混响场景下优于传统方法。

关键词

引用

@article{arxiv.2005.10479,
  title  = {End-to-End Far-Field Speech Recognition with Unified Dereverberation and Beamforming},
  author = {Wangyou Zhang and Aswin Shanmugam Subramanian and Xuankai Chang and Shinji Watanabe and Yanmin Qian},
  journal= {arXiv preprint arXiv:2005.10479},
  year   = {2021}
}

备注

5 pages, 3 figures, conference