中文

端到端语音识别训练如何影响语音增强伪影?

音频与语音处理 2023-11-21 v1

摘要

联合训练语音增强(SE)前端与自动语音识别(ASR)后端已被研究作为一种减轻单通道 SE 所产生的“处理失真”对 ASR 影响的方法。本文中,我们从分解后的噪声与伪影误差视角,研究此种联合训练对增强信号在信号级特征上的影响。实验分析给出两个新发现:1)对 SE 前端进行 ASR 级训练减少了伪影误差但增加了噪声误差;2)简单地对增强信号与观测信号进行插值——其达到类似减少伪影并增加噪声的效果——无需联合修改 SE 与 ASR 模块即可改善 ASR 性能,即便对于使用 WavLM 特征提取器的强 ASR 后端也是如此。我们的发现增进了对联合训练效果的理解,并为设计 ASR 无关型 SE 前端提供了新见解。

关键词

引用

@article{arxiv.2311.11599,
  title  = {How does end-to-end speech recognition training impact speech enhancement artifacts?},
  author = {Kazuma Iwamoto and Tsubasa Ochiai and Marc Delcroix and Rintaro Ikeshita and Hiroshi Sato and Shoko Araki and Shigeru Katagiri},
  journal= {arXiv preprint arXiv:2311.11599},
  year   = {2023}
}

备注

5 pages, 1 figure, 1 table