中文

基于扩散模型、具有帧级韵律特征的高度可控任意到任意语音转换模型

声音 2023-09-08 v1 音频与语音处理

摘要

我们提出了一种高度可控的语音处理系统,能够同时执行任意到任意语音转换(VC)与韵律调制。最先进的 VC 系统可以迁移句子级特征,如说话人、情感与说话风格。然而,对帧级韵律(如音高、能量与语速)的操控仍具挑战性。我们提出的模型利用帧级韵律特征来有效迁移此类属性。具体而言,音高与能量轨迹被整合进一个韵律条件模块,随后与说话人及内容嵌入一同送入基于扩散(diffusion)的解码器,生成转换后的语音梅尔频谱图。为调节语速,我们的系统包含一个基于自监督模型的后处理步骤,从而提升可控性。所提模型相较 SOTA 方法展现出可比的语音质量与更佳的可懂度。它能在保持转换语音质量的同时,覆盖基频(F0)、能量与速度调制的可变范围。

关键词

引用

@article{arxiv.2309.03364,
  title  = {Highly Controllable Diffusion-based Any-to-Any Voice Conversion Model with Frame-level Prosody Feature},
  author = {Kyungguen Byun and Sunkuk Moon and Erik Visser},
  journal= {arXiv preprint arXiv:2309.03364},
  year   = {2023}
}

备注

5 pages, 3 figures, submitted to ICASSP 2024