用于鲁棒波形生成的去噪去混响分层神经声码器
声音
2020-11-10 v1 音频与语音处理
摘要
本文提出一种去噪去混响分层神经声码器(DNR-HiNet),用于将含噪且带混响的声学特征转换为干净的语音波形。我们主要通过修改原始 HiNet 声码器中的幅度谱预测器(ASP)来实现该模型。这一修改后的去噪去混响 ASP(DNR-ASP)能够从输入的退化声学特征中预测干净的 log 幅度谱(LAS)。为此,DNR-ASP 首先预测含噪且带混响的 LAS、与噪声信息相关的噪声 LAS,以及与混响信息相关的房间脉冲响应,随后执行初步的去噪与去混响。初步处理后的 LAS 再由另一个神经网络增强为最终的干净 LAS。为了进一步提升所生成干净 LAS 的质量,我们还在 DNR-ASP 中引入了带宽扩展模型与频率分辨率扩展模型。实验结果表明,DNR-HiNet 声码器能够在给定含噪且带混响的声学特征时生成去噪去混响的波形,并且优于原始 HiNet 声码器及另外几种神经声码器。我们还将 DNR-HiNet 声码器应用于语音增强任务,其性能与几种先进的语音增强方法相当。
引用
@article{arxiv.2011.03955,
title = {Denoising-and-Dereverberation Hierarchical Neural Vocoder for Robust Waveform Generation},
author = {Yang Ai and Haoyu Li and Xin Wang and Junichi Yamagishi and Zhenhua Ling},
journal= {arXiv preprint arXiv:2011.03955},
year = {2020}
}
备注
Accepted by SLT 2021