VoiceFixer:面向通用语音修复的神经声码器方法
声音
2021-10-06 v3 音频与语音处理
摘要
语音修复旨在去除语音信号中的失真。先前的方法主要关注单任务语音修复(SSR),如语音去噪或语音去削波。然而,SSR系统仅关注单一任务,并未解决通用语音修复问题。此外,以往的SSR系统在某些语音修复任务(如语音超分辨率)上表现有限。为克服这些局限,我们提出一种通用语音修复(GSR)任务,试图同时去除多种失真。进一步,我们提出VoiceFixer,一种用于解决GSR任务的生成式框架。VoiceFixer由分析阶段与合成阶段组成,以模拟人听觉系统的语音分析与理解过程。我们采用ResUNet建模分析阶段,采用神经声码器(neural vocoder)建模合成阶段。我们在加性噪声、房间混响、低分辨率与削波失真下评估VoiceFixer。我们的基线GSR模型比语音增强SSR模型的平均意见得分(MOS)高出0.499。VoiceFixer在MOS得分上进一步超越GSR基线模型0.256。此外,我们观察到VoiceFixer对严重退化的真实语音录音具有良好的泛化能力,表明其在修复老电影与历史演讲方面的潜力。源代码见 https://github.com/haoheliu/voicefixer_main。
引用
@article{arxiv.2109.13731,
title = {VoiceFixer: Toward General Speech Restoration with Neural Vocoder},
author = {Haohe Liu and Qiuqiang Kong and Qiao Tian and Yan Zhao and DeLiang Wang and Chuanzeng Huang and Yuxuan Wang},
journal= {arXiv preprint arXiv:2109.13731},
year = {2021}
}