中文

用于噪声鲁棒 ASR 的带双向投影融合模块的跨域单通道语音增强模型

音频与语音处理 2021-08-27 v1 多媒体 声音 信号处理

摘要

近几十年来,许多研究表明相位信息对语音增强(SE)至关重要,并且时域单通道语音增强技术在噪声抑制和鲁棒的自动语音识别(ASR)中展现出了潜力。本文是上述研究路线的延续,并探索了分别在语音信号的时域和频域中考虑相位信息的两种有效 SE 方法。更进一步,我们提出了一种新颖的跨域语音增强模型和一种用于噪声鲁棒 ASR 的双向投影融合(BPF)机制。为了评估所提方法的有效性,我们在公开可用的 Aishell-1 普通话基准语音语料库上进行了大量实验。评估结果证实,在分别被已知和未知噪声污染的场景测试集中,无论是在增强还是 ASR 评估指标上,我们提出的方法相较于目前几种最先进的时域和频域 SE 方法均具有优越性。

关键词

引用

@article{arxiv.2108.11598,
  title  = {Cross-domain Single-channel Speech Enhancement Model with Bi-projection Fusion Module for Noise-robust ASR},
  author = {Fu-An Chao and Jeih-weih Hung and Berlin Chen},
  journal= {arXiv preprint arXiv:2108.11598},
  year   = {2021}
}

备注

6 pages, 3 figures, Accepted by ICME 2021