CleanMel:用于提高语音质量和自动语音识别性能的 Mel 频谱图增强
音频与语音处理
2025-07-31 v2 人工智能
声音
摘要
本文提出了 CleanMel, 一个单声道 Mel 频谱图去噪和去混响网络,用于提高语音质量和自动语音识别(ASR)性能。该网络以噪声和混响的麦克风录音为输入,预测对应的干净 Mel 频谱图。增强后的 Mel 频谱图可转换为语音波形用于神经声学模型,或直接用于 ASR。该网络在 Mel 频率域中交替进行跨带和窄带处理,分别学习全频谱模式和窄带信号特性。与线性频率域或时域语音增强相比,Mel 频率增强的关键优势在于,Mel 频率更紧凧地呈现语音,因此更易学习,这将同时提高语音质量和 ASR 性能。在五组英语和一组中文数据集上的实验结果表明,该模型在语音质量和 ASR 性能方面均实现了显著提升。我们的代码和音频示例已在线发布。
引用
@article{arxiv.2502.20040,
title = {CleanMel: Mel-Spectrogram Enhancement for Improving Both Speech Quality and ASR},
author = {Nian Shao and Rui Zhou and Pengyu Wang and Xian Li and Ying Fang and Yujie Yang and Xiaofei Li},
journal= {arXiv preprint arXiv:2502.20040},
year = {2025}
}
备注
Submission to IEEE/ACM Trans. on TASLP