中文

利用歌声、风格过滤和基频匹配改进基于数据增强的跨说话人风格迁移用于文本转语音

音频与语音处理 2024-10-10 v1

摘要

文本转语音中跨说话人风格迁移的目标是将语音风格从具有表现力数据的源说话人迁移到仅有中性数据的目标说话人。在此背景下,我们提出使用预训练的歌声转换模型将表现力数据转换为目标说话人的声音。在转换过程中,我们应用基频匹配技术来减轻音色差异显著的说话人之间的音调差异。提出了一种风格分类器过滤器,用于选择最具表现力的输出音频用于文本转语音训练。我们的方法与最先进技术相当,仅需目标说话人几分钟的中性数据,而其他方法则需要数小时。感知评估表明,对于表现出更多发声努力的风格,歌声转换和风格过滤器在自然度和风格强度方面带来了改进。此外,通过所提出的基频匹配算法获得了更高的说话人相似度。

关键词

引用

@article{arxiv.2410.05620,
  title  = {Improving Data Augmentation-based Cross-Speaker Style Transfer for TTS with Singing Voice, Style Filtering, and F0 Matching},
  author = {Leonardo B. de M. M. Marques and Lucas H. Ueda and Mário U. Neto and Flávio O. Simões and Fernando Runstein and Bianca Dal Bó and Paula D. P. Costa},
  journal= {arXiv preprint arXiv:2410.05620},
  year   = {2024}
}

备注

Submitted to INTERSPEECH 2024