HiFi-GAN:基于对抗网络中语音深度特征的高保真去噪与去混响
音频与语音处理
2020-09-23 v2 机器学习
声音
摘要
真实世界音频录音常因噪声、混响和均衡失真等因素而退化。本文介绍 HiFi-GAN,一种将录音语音转换为宛如录音棚录制声音的深度学习方法。我们采用端到端前馈 WaveNet 架构,在时域与时频域中使用多尺度对抗判别器进行训练。它依靠判别器的深度特征匹配损失来提升增强语音的感知质量。所提模型对新说话人、新语音内容和新环境具有良好泛化能力。在客观与主观实验中均显著优于最先进的基线方法。
引用
@article{arxiv.2006.05694,
title = {HiFi-GAN: High-Fidelity Denoising and Dereverberation Based on Speech Deep Features in Adversarial Networks},
author = {Jiaqi Su and Zeyu Jin and Adam Finkelstein},
journal= {arXiv preprint arXiv:2006.05694},
year = {2020}
}
备注
Accepted by INTERSPEECH 2020