使用归一化流创建新声音
声音
2023-12-25 v1 人工智能
音频与语音处理
摘要
创建逼真且听起来自然的合成语音对于训练中未见过的语音身份仍然是一个重大挑战。随着对合成新说话人声音的兴趣日益增长,我们在此研究了归一化流在文本到语音(TTS)和语音转换(VC)模式下从训练中观察到的说话人外推以创建未见说话人身份的能力。首先,我们创建了一种用于TTS和VC的方法,然后我们全面评估了我们的方法和基线在可懂度、自然度、说话人相似度以及创建新声音的能力方面的表现。我们使用客观和主观指标在两个评估任务上对我们的技术进行基准测试:零样本和新语音合成。前一个任务的目标是衡量对未见声音转换的精度。后一个任务的目标是衡量创建新声音的能力。大量评估表明,所提出的方法系统性地在零样本语音合成中获得了最先进的性能,并创建了训练集中未观察到的各种新声音。我们认为这项工作是首次尝试基于梅尔频谱图和归一化流合成新声音,同时对TTS和VC模式进行了全面分析和比较。
引用
@article{arxiv.2312.14569,
title = {Creating New Voices using Normalizing Flows},
author = {Piotr Bilinski and Thomas Merritt and Abdelhamid Ezzerg and Kamil Pokora and Sebastian Cygert and Kayoko Yanagisawa and Roberto Barra-Chicote and Daniel Korzekwa},
journal= {arXiv preprint arXiv:2312.14569},
year = {2023}
}
备注
Interspeech 2022