中文

伪影有多糟?:分析语音增强误差对 ASR 的影响

音频与语音处理 2022-03-31 v2 声音

摘要

在噪声条件下通过单通道语音增强(SE)提升自动语音识别(ASR)性能颇具挑战。本文通过基于正交投影分解(OPD)的 SE 误差分解,探究 ASR 性能退化的成因。OPD 将 SE 误差分解为噪声与伪影分量。伪影分量定义为无法表示为语音与噪声源线性组合的 SE 误差信号。我们提出手动缩放误差分量以分析其对 ASR 的影响。实验确定伪影分量为性能退化的主因,并发现减轻伪影可大幅改善 ASR 性能。此外,我们证明简单的观测相加(OA)技术(即向增强语音加入观测信号的缩放版本)可在温和条件下单调提升信伪比。据此,我们经实验确认 OA 对模拟与真实录音均改善 ASR 性能。本文发现增进了对 SE 误差影响 ASR 的理解,并为未来设计高效单通道 SE 前端以用于 ASR 的新方法研究敞开大门。

关键词

引用

@article{arxiv.2201.06685,
  title  = {How Bad Are Artifacts?: Analyzing the Impact of Speech Enhancement Errors on ASR},
  author = {Kazuma Iwamoto and Tsubasa Ochiai and Marc Delcroix and Rintaro Ikeshita and Hiroshi Sato and Shoko Araki and Shigeru Katagiri},
  journal= {arXiv preprint arXiv:2201.06685},
  year   = {2022}
}

备注

5 pages, 5 figures, submitted to Interspeech 2022