中文

Voice-ENHANCE:基于扩散模型的语音恢复框架

声音 2025-05-22 v1 音频与语音处理

摘要

我们提出了一种语音增强系统,将说话人无关的语音恢复与语音转换(VC)相结合,以获得面向录音室水平的语音信号。虽然语音转换模型通常用于改变说话人特征,但当目标说话人与源说话人相同时,语音转换模型也可作为语音恢复的手段。然而,由于VC模型对噪声环境较为敏感,我们在本系统的前端加入了生成式语音恢复(GSR)模型。GSR模型在不了解目标说话人信息的情况下,执行降噪并恢复该过程中的语音损坏。随后,VC阶段利用来自干净说话人嵌入的指导进一步恢复输出语音。通过采用两阶段方法,我们在多个数据集上实现了与当前最先进(SOTA)方法相当的语音质量目标指标得分。

关键词

引用

@article{arxiv.2505.15254,
  title  = {Voice-ENHANCE: Speech Restoration using a Diffusion-based Voice Conversion Framework},
  author = {Kyungguen Byun and Jason Filos and Erik Visser and Sunkuk Moon},
  journal= {arXiv preprint arXiv:2505.15254},
  year   = {2025}
}

备注

5 pages, 3 figures, Accepted to INTERSPEECH 2025