我们是否总该分离?:在重叠语音识别中于增强与观测信号间切换
音频与语音处理
2022-06-17 v1 声音
摘要
尽管深度学习技术的最新进展改善了自动语音识别(ASR),但当语音与他人的声音重叠时,识别仍很困难。语音分离或提取常作为ASR的前端以处理此类重叠语音。然而,基于深度神经网络的语音增强会产生‘处理伪影’作为增强的副作用,从而降低ASR性能。例如,众所周知,针对非语音噪声(非重叠语音)的单通道降噪通常无法改善ASR。类似地,尽管通常认为分离/提取能改善ASR,但在某些条件下用分离/提取方法处理重叠语音时,处理伪影也可能损害ASR。为回答‘我们是否总要从混合信号中分离/提取语音?’这一问题,我们分析了在不同噪声和干扰条件下观测语音与增强语音上的ASR性能,表明即使在重叠语音情况下,语音增强在某些条件下也会降低ASR。基于这些发现,我们提出了一种基于估计的信干比和信噪比在观测与增强语音间简单切换的算法。实验证明,当处理伪影损害ASR时,这种简单切换机制可改善识别性能。
引用
@article{arxiv.2106.00949,
title = {Should We Always Separate?: Switching Between Enhanced and Observed Signals for Overlapping Speech Recognition},
author = {Hiroshi Sato and Tsubasa Ochiai and Marc Delcroix and Keisuke Kinoshita and Takafumi Moriya and Naoyuki Kamo},
journal= {arXiv preprint arXiv:2106.00949},
year = {2022}
}
备注
5 pages, 1 figure