中文

Voicy:噪声混响环境下的零样本非平行语音转换

声音 2021-06-17 v1 机器学习 音频与语音处理

摘要

语音转换(VC)是一种旨在转换源话语的非语言信息以改变说话人感知身份的技术。尽管关于 VC 的文献丰富,但大多数提出的方法是在干净语音记录上训练和评估的。然而,许多声学环境是含噪且混响的,严重限制了流行 VC 方法在此类场景中的适用性。为解决此限制,我们提出了 Voicy,一种特别为噪声语音量身定制的新 VC 框架。我们的方法受去噪自编码器框架启发,由四个编码器(说话人、内容、音素和声学-ASR)和一个解码器组成。重要的是,Voicy 能够执行非平行零样本 VC,这是任何需要在训练时未见过说话人上工作的 VC 系统的重要要求。我们使用 LibriSpeech 数据集的噪声混响版本验证了我们的方法。实验结果表明,在噪声混响环境中,Voicy 在自然度和目标说话人相似度方面优于其他被测 VC 技术。

关键词

引用

@article{arxiv.2106.08873,
  title  = {Voicy: Zero-Shot Non-Parallel Voice Conversion in Noisy Reverberant Environments},
  author = {Alejandro Mottini and Jaime Lorenzo-Trueba and Sri Vishnu Kumar Karlapati and Thomas Drugman},
  journal= {arXiv preprint arXiv:2106.08873},
  year   = {2021}
}

备注

Presented at the Speech Synthesis Workshops 2021 (SSW11)