中文

基于语音与噪声双流谱图精炼网络及语音失真损失的鲁棒语音识别

声音 2023-05-31 v2 音频与语音处理

摘要

近年来,语音增强前端与自动语音识别(ASR)后端的联合训练被广泛用于提升 ASR 系统的鲁棒性。传统联合训练方法仅将增强语音作为后端输入。然而,由于噪声类型多样且强度不同,语音增强系统难以直接从输入中分离语音。此外,增强语音中常出现语音失真与残留噪声,且语音与噪声的失真方式不同。现有多数方法聚焦于融合增强与含噪特征以解决此问题。本文中,我们提出一种双流谱图精炼网络,同时精炼语音与噪声,并从含噪输入中解耦噪声。我们所提方法取得了更优性能,字符错误率(CER)相对降低 8.6%。

关键词

引用

@article{arxiv.2305.17860,
  title  = {speech and noise dual-stream spectrogram refine network with speech distortion loss for robust speech recognition},
  author = {Haoyu Lu and Nan Li and Tongtong Song and Longbiao Wang and Jianwu Dang and Xiaobao Wang and Shiliang Zhang},
  journal= {arXiv preprint arXiv:2305.17860},
  year   = {2023}
}