Diff-HierVC:基于扩散的分层语音转换,具有鲁棒音高生成与掩码先验以实现零样本说话人自适应
音频与语音处理
2023-11-09 v1 人工智能
声音
信号处理
摘要
尽管语音转换(VC)系统已展现出迁移语音风格的显著能力,现有方法仍存在音高不准确与说话人自适应质量低的问题。为应对这些挑战,我们提出 Diff-HierVC,一种基于两个扩散模型的分层 VC 系统。我们首先引入 DiffPitch,可有效生成具有目标语音风格的 F0。随后,生成的 F0 被输入 DiffVoice 以转换具有目标语音风格的语音。此外,利用源-滤波器编码器解耦语音,并将转换后的梅尔谱作为 DiffVoice 中数据驱动的先验以提升语音风格迁移能力。最后,通过在扩散模型中使用掩码先验,我们的模型可提升说话人自适应质量。实验结果验证了我们的模型在音高生成与语音风格迁移性能上的优越性,且在零样本 VC 场景下取得 CER 0.83% 与 EER 3.29% 的表现。
引用
@article{arxiv.2311.04693,
title = {Diff-HierVC: Diffusion-based Hierarchical Voice Conversion with Robust Pitch Generation and Masked Prior for Zero-shot Speaker Adaptation},
author = {Ha-Yeong Choi and Sang-Hoon Lee and Seong-Whan Lee},
journal= {arXiv preprint arXiv:2311.04693},
year = {2023}
}
备注
INTERSPEECH 2023 (Oral)