VoiceFixer:一种用于高保真语音修复的统一框架
音频与语音处理
2023-10-10 v2 声音
信号处理
摘要
语音修复旨在去除语音信号中的失真。先前的方法主要关注单一类型的失真,例如语音去噪或去混响。然而在现实世界中,语音信号可能同时被多种不同的失真所退化。因此,扩展语音修复模型以处理多种失真十分重要。本文提出 VoiceFixer,一种用于高保真语音修复的统一框架。VoiceFixer 可从多种失真(如噪声、混响和削波)中修复语音,并能够将带宽较低的退化语音(如含噪语音)扩展为 44.1 kHz 全带宽高保真语音。我们基于(1)从退化语音中预测中间层特征的分析阶段,以及(2)使用神经声码器生成波形的合成阶段来设计 VoiceFixer。客观与主观评测均表明,VoiceFixer 对严重退化的语音(如真实世界的历史语音录音)十分有效。VoiceFixer 的样例可在 https://haoheliu.github.io/voicefixer 获取。
引用
@article{arxiv.2204.05841,
title = {VoiceFixer: A Unified Framework for High-Fidelity Speech Restoration},
author = {Haohe Liu and Xubo Liu and Qiuqiang Kong and Qiao Tian and Yan Zhao and DeLiang Wang and Chuanzeng Huang and Yuxuan Wang},
journal= {arXiv preprint arXiv:2204.05841},
year = {2023}
}
备注
Submitted to INTERSPEECH 2022