使用条件变分自编码器实现多样化语调的语音转换
声音
2025-04-17 v1 机器学习
音频与语音处理
摘要
语音转换是指合成带有目标说话人声音的语料,同时保持源语料的语言信息。虽然说话人可以以不同的语调从单个脚本中产生不同的语料,但常规的语音转换模型仅能为单个输入产生一个结果。为克服这一限制,我们提出了一种使用条件变分自编码器 (CVAE) 实现语音转换并生成多样化语调的新方法。实验表明,说话人的风格特征可以映射到具有高斯分布的潜在空间中。我们还能够通过使潜在空间的后验分布更复杂(使用逆自回归流 IAF),实现语音转换后产生更丰富的语调。结果表明,转换后的语音不仅具有多样化的语调,而且比不使用 CVAE 的模型在语音质量方面更优。
引用
@article{arxiv.2504.12005,
title = {Voice Conversion with Diverse Intonation using Conditional Variational Auto-Encoder},
author = {Soobin Suh and Dabi Ahn and Heewoong Park and Jonghun Park},
journal= {arXiv preprint arXiv:2504.12005},
year = {2025}
}
备注
2 pages, Machine Learning in Speech and Language Processing Workshop (MLSLP) 2018