中文

面向噪声到噪声语音转换的直接含噪语音建模

声音 2021-11-16 v1 音频与语音处理

摘要

除了在不改变语言内容的情况下转换说话人信息的传统语音转换(VC)之外,背景声音在某些真实场景中是富含信息且需要保留的,例如电影/视频中的VC以及语音与背景声音纠缠在一起的音乐中的VC。作为一种新的VC框架,我们开发了噪声到噪声(N2N) VC框架,以在保留背景声音的同时转换说话人身份。尽管我们由去噪模块和VC模块组成的框架能很好地处理背景声音,但VC模块对去噪模块引起的失真很敏感。为解决该失真问题,本文提出改进的VC模块,在控制背景声音的同时直接对含噪语音波形进行建模。实验结果表明,我们改进的框架显著优于先前框架,在自然度方面取得了可接受的分值,同时达到了与框架上限相当的相似度表现。

关键词

引用

@article{arxiv.2111.07116,
  title  = {Direct Noisy Speech Modeling for Noisy-to-Noisy Voice Conversion},
  author = {Chao Xie and Yi-Chiao Wu and Patrick Lumban Tobing and Wen-Chin Huang and Tomoki Toda},
  journal= {arXiv preprint arXiv:2111.07116},
  year   = {2021}
}