中文

VoiceFixer:一种用于高保真语音修复的统一框架

音频与语音处理 2023-10-10 v2 声音 信号处理

摘要

语音修复旨在去除语音信号中的失真。先前的方法主要关注单一类型的失真,例如语音去噪或去混响。然而在现实世界中,语音信号可能同时被多种不同的失真所退化。因此,扩展语音修复模型以处理多种失真十分重要。本文提出 VoiceFixer,一种用于高保真语音修复的统一框架。VoiceFixer 可从多种失真(如噪声、混响和削波)中修复语音,并能够将带宽较低的退化语音(如含噪语音)扩展为 44.1 kHz 全带宽高保真语音。我们基于(1)从退化语音中预测中间层特征的分析阶段,以及(2)使用神经声码器生成波形的合成阶段来设计 VoiceFixer。客观与主观评测均表明,VoiceFixer 对严重退化的语音(如真实世界的历史语音录音)十分有效。VoiceFixer 的样例可在 https://haoheliu.github.io/voicefixer 获取。

关键词

引用

@article{arxiv.2204.05841,
  title  = {VoiceFixer: A Unified Framework for High-Fidelity Speech Restoration},
  author = {Haohe Liu and Xubo Liu and Qiuqiang Kong and Qiao Tian and Yan Zhao and DeLiang Wang and Chuanzeng Huang and Yuxuan Wang},
  journal= {arXiv preprint arXiv:2204.05841},
  year   = {2023}
}

备注

Submitted to INTERSPEECH 2022