中文

Mel-FullSubNet:用于提升语音质量和语音识别性能的 Mel 频谱增强

音频与语音处理 2024-02-23 v2

摘要

本文提出了 Mel-FullSubNet,一种单通道 Mel 频谱去噪和去混响网络,用于提升语音质量和自动语音识别(ASR)性能。Mel-FullSubNet 以噪声和混响的 Mel 频谱为输入,预测对应的干净 Mel 频谱。增强后的 Mel 频谱可通过神经声学解码器转换为语音波形,或直接用于 ASR。Mel-FullSubNet 包含交错的全带和子带网络,分别用于学习信号的全带谱模式和子带/窄带特性。与线性频率域或时域语音增强相比,Mel 频谱增强的主要优势在于 Mel 频率以更紧凑的方式呈现语音,从而更容易学习,这将受益于语音质量和 ASR。实验结果表明,所提出的模型在语音质量和 ASR 性能方面均实现了显著的改善。

关键词

引用

@article{arxiv.2402.13511,
  title  = {Mel-FullSubNet: Mel-Spectrogram Enhancement for Improving Both Speech Quality and ASR},
  author = {Rui Zhou and Xian Li and Ying Fang and Xiaofei Li},
  journal= {arXiv preprint arXiv:2402.13511},
  year   = {2024}
}