中文

面向噪声与混响条件的三阶段语音转换框架评估

声音 2022-07-01 v1 音频与语音处理

摘要

本文提出一种能够处理加性噪声与混响的语音转换(VC)框架,并对其进行性能评估。已有一些 VC 研究关注语音数据受背景噪声与混响干扰的真实世界环境。为应对无干净目标数据集可用的更实际条件,一种可能的方法是零样本 VC,但其性能往往较使用充足目标语音数据的 VC 有所下降。为利用大量含噪混响目标语音数据,我们提出一种三阶段 VC 框架,基于预训练去噪模型的去噪过程、使用去混响模型的去混响过程,以及基于变分自编码器的非并行 VC 模型进行 VC 过程。实验结果表明:1) 噪声与混响叠加导致显著的 VC 性能退化;2) 所提方法缓解了噪声与混响带来的不利影响,并显著优于直接在含噪混响语音数据上训练的基线;3) 去噪与去混响引入的潜在退化仍对 VC 性能造成明显的不良影响。

关键词

引用

@article{arxiv.2206.15155,
  title  = {An Evaluation of Three-Stage Voice Conversion Framework for Noisy and Reverberant Conditions},
  author = {Yeonjong Choi and Chao Xie and Tomoki Toda},
  journal= {arXiv preprint arXiv:2206.15155},
  year   = {2022}
}

备注

Accepted to INTERSPEECH 2022