重构处理失真:离散语音增强误差对语音识别性能的解耦影响
音频与语音处理
2024-04-24 v1 声音
摘要
在噪声环境下提高单通道语音识别(ASR)性能具有挑战性,通常归因于单通道语音增强(SE)前端的非线性处理所致的处理失真。然而,导致ASR性能下降的根本原因尚未充分调查。如何设计能够显著提升ASR性能的单通道SE前端仍是开放问题。本研究调查了一种可解释ASR性能下降原因的信号级数值指标。为此,我们提出一种基于SE误差正交投影分解的新型分析方案。该方案手动修改分解后的干扰、噪声和伪影误差比例,使我们能够直接评估每种误差类型对ASR性能的影响。我们的分析揭示了伪影误差对ASR性能影响尤为严重,其他误差类型影响较小。这为我们提供了更原则化的处理失真定义,以解释ASR性能下降的原因。随后,我们研究了两种实际可行的降低伪影误差影响的方法。首先,我们证明了简单观察添加(OA)后处理(即对增强信号与观察信号进行插值)可单调提高信噪比。其次,我们提出一种新型训练目标,称为基于伪影提升的信噪比(AB-SDR),该目标迫使模型估计的增强信号具有更少的伪影误差。通过实验,我们确认OA和AB-SDR两种方法在降低单通道SE前端产生的伪影误差方面均有效,从而显著提高了ASR性能。
引用
@article{arxiv.2404.14860,
title = {Rethinking Processing Distortions: Disentangling the Impact of Speech Enhancement Errors on Speech Recognition Performance},
author = {Tsubasa Ochiai and Kazuma Iwamoto and Marc Delcroix and Rintaro Ikeshita and Hiroshi Sato and Shoko Araki and Shigeru Katagiri},
journal= {arXiv preprint arXiv:2404.14860},
year = {2024}
}
备注
13 pages, 6 figures, Submitted to IEEE/ACM Trans. Audio, Speech, and Language Processing