中文

ConVoice:基于卷积网络的实时零样本语音风格转换

音频与语音处理 2020-05-19 v1 声音

摘要

我们提出了一种无需任何平行或转写数据的零样本语音转换(VC)神经网络。我们的方法使用了从说话人验证任务中获得的预训练自动语音识别(ASR)模型和说话人嵌入模型。除一个用于说话人编码的小型预训练循环神经网络外,我们的模型完全为卷积且非自回归结构。得益于其卷积架构,ConVoice 能够转换任意长度的语音而不损失质量。我们的模型质量可与同类最先进(SOTA)模型相媲美,同时速度极快。

关键词

引用

@article{arxiv.2005.07815,
  title  = {ConVoice: Real-Time Zero-Shot Voice Style Transfer with Convolutional Network},
  author = {Yurii Rebryk and Stanislav Beliaev},
  journal= {arXiv preprint arXiv:2005.07815},
  year   = {2020}
}