中文

基于离散音高条件流匹配模型提升情感语音转换的表达能力

声音 2025-02-11 v1 音频与语音处理

摘要

本文介绍了PFlow-VC,一款用于情感语音转换的条件流匹配语音转换模型,利用细粒度离散音高标记和目标说话人提示信息。以往的VC工作主要关注说话人转换,进一步探索提升情感语音转换模型的表达性(如语调和情感)仍有必要。与以往方法不同,本文采用一种简单且高效的方法来增强语音转换模型的风格表达性。具体而言,我们预训练一个自监督音高 VQVAE 模型以离散化与说话人无关的音高信息,并利用掩码音高条件流匹配模型进行Mel频谱合成,该模型为说话人转换模型提供上下文音高建模能力,有效提升了语音风格迁移能力。此外,我们通过将全局说话人嵌入与时变说话人标记结合,提高了语音的时域相似度。在未见的LibriTTS test-clean和情感语音数据集 ESD 上的实验表明,PFlow-VC模型在说话人转换和风格迁移方面均表现出色。音频样本可在演示页面 https://speechai-demo.github.io/PFlow-VC/ 查看。

关键词

引用

@article{arxiv.2502.05471,
  title  = {Enhancing Expressive Voice Conversion with Discrete Pitch-Conditioned Flow Matching Model},
  author = {Jialong Zuo and Shengpeng Ji and Minghui Fang and Ziyue Jiang and Xize Cheng and Qian Yang and Wenrui Liu and Guangyan Zhang and Zehai Tu and Yiwen Guo and Zhou Zhao},
  journal= {arXiv preprint arXiv:2502.05471},
  year   = {2025}
}

备注

Accepted by ICASSP 2025