探索合成数据在基于风格表示的 TTS 中用于跨说话人风格迁移
音频与语音处理
2024-09-27 v1 声音
摘要
在文本到语音模型中融入跨说话人风格迁移具有挑战性,因为需要解耦音频中的说话人和风格信息。在低资源表现力数据场景下,语音转换可以生成目标说话人的表现力语音,然后用于训练 TTS 模型。然而,VC 模型的质量和风格迁移能力对整体 TTS 模型质量至关重要。在这项工作中,我们探索使用 VC 模型生成的合成数据来辅助 TTS 模型完成跨说话人风格迁移任务。此外,我们采用音色扰动和原型角损失对风格编码器进行预训练,以减轻说话人泄漏。结果表明,使用 VC 合成数据可以提高跨说话人场景下 TTS 的自然度和说话人相似度。此外,我们将此方法扩展到跨语言场景,增强了口音迁移。
引用
@article{arxiv.2409.17364,
title = {Exploring synthetic data for cross-speaker style transfer in style representation based TTS},
author = {Lucas H. Ueda and Leonardo B. de M. M. Marques and Flávio O. Simões and Mário U. Neto and Fernando Runstein and Bianca Dal Bó and Paula D. P. Costa},
journal= {arXiv preprint arXiv:2409.17364},
year = {2024}
}
备注
Accepted at SynData4GenAI 2024