PRESENT:零样文本到抑扬控制
音频与语音处理
2025-01-08 v1 机器学习
摘要
当前实现语音合成中细粒度抑扬控制的策略包括提取额外的风格嵌入或采用更复杂的体系结构。为实现预训练文本语音合成(TTS)模型的零样应用,我们提出了PRESENT(PRosody Editing without Style Embeddings or New Training),该方法通过直接修改推理过程来利用基于FastSpeech2的模型中的显式抑扬预测。我们将文本到抑扬框架用于零样语言迁移,使用仅在英语LJSpeech数据上训练的JETS模型。我们获得了为德语、匈牙利语和西班牙语分别为12.8%、18.7%和5.9%的字符错误率(CER),均优于前一最佳CER超过2倍。此外,我们实现了亚音级控制,这在该领域是首次。为评估其效果,我们表明PRESENT可改善疑问句的抑扬,并用于生成中文,一种在亚音级变化 vowel pitch 的声调语言。我们使用JETS模型获得了25.3%的汉字CER和13.0%的拼音CER。我们的所有代码和音频样本均已在线提供。
引用
@article{arxiv.2408.06827,
title = {PRESENT: Zero-Shot Text-to-Prosody Control},
author = {Perry Lam and Huayun Zhang and Nancy F. Chen and Berrak Sisman and Dorien Herremans},
journal= {arXiv preprint arXiv:2408.06827},
year = {2025}
}