学习增强与否:基于神经网络的增强与观测信号切换用于重叠语音识别
音频与语音处理
2022-06-17 v1 声音
摘要
基于深度神经网络(DNN)的语音增强(SE)前端与自动语音识别(ASR)后端相结合是实现重叠语音识别的广泛使用的方法。然而,SE 前端会产生处理伪影,从而降低 ASR 性能。我们之前发现,即使在完全重叠条件下,这种性能下降也可能发生,取决于信干比(SIR)和信噪比(SNR)。为了减轻这种下降,我们引入了一种基于规则的方法来在增强信号和观测信号之间切换 ASR 输入,显示出了有前景的结果。然而,该规则的最优性不明确,因为它是启发式设计的且仅基于 SIR 和 SNR 值。在这项工作中,我们提出了一种基于 DNN 的切换方法,直接估计 ASR 在增强信号还是观测信号上表现更好。我们还引入了软切换,计算增强信号和观测信号的加权和作为 ASR 输入,权重由切换模型输出的后验概率给出。所提出的基于学习的切换显示出与基于规则的预言切换相当的性能。软切换进一步改善了 ASR 性能,与传统方法相比实现了高达 23% 的相对字符错误率降低。
引用
@article{arxiv.2201.03881,
title = {Learning to Enhance or Not: Neural Network-Based Switching of Enhanced and Observed Signals for Overlapping Speech Recognition},
author = {Hiroshi Sato and Tsubasa Ochiai and Marc Delcroix and Keisuke Kinoshita and Naoyuki Kamo and Takafumi Moriya},
journal= {arXiv preprint arXiv:2201.03881},
year = {2022}
}
备注
5 pages, 2 figures