中文

带去噪模型的含噪到含噪语音转换框架

声音 2021-09-23 v1 音频与语音处理

摘要

在传统的语音转换(VC)框架中,VC模型通常使用由精心录制并尽量减少背景干扰而筛选出的语音数据构成的干净数据集进行训练。然而,收集此类高质量数据集成本高昂且耗时。利用众包语音数据进行训练则更为经济。此外,对于一些现实世界的VC场景,例如视频中的VC以及用于语音识别系统的基于VC的数据增强,背景声音本身也包含信息,需要予以保留。本文中,为探索能够灵活处理背景声音的VC方法,我们提出了一种由去噪模块和VC模块组成的含噪到含噪(N2N)VC框架。借助所提框架,我们可以在保留背景声音的同时转换说话人身份。我们进行了客观与主观评价,结果揭示了所提框架的有效性。

关键词

引用

@article{arxiv.2109.10608,
  title  = {Noisy-to-Noisy Voice Conversion Framework with Denoising Model},
  author = {Chao Xie and Yi-Chiao Wu and Patrick Lumban Tobing and Wen-Chin Huang and Tomoki Toda},
  journal= {arXiv preprint arXiv:2109.10608},
  year   = {2021}
}