基于韵律提示的 Stable-TTS:面向说话人自适应的稳定文本转语音
声音
2024-12-31 v1 人工智能
音频与语音处理
摘要
说话人自适应文本转语音 (TTS) 合成因其广泛的应用场景(如个性化语音助手服务)而引起广泛关注。尽管已提出多种方法,但它们往往对目标语音样本的数量或质量高度敏感。为此,本文引入 Stable-TTS 框架,利用小规模高质量预训练数据集(称为先验样本)中的韵律信息。具体而言,Stable-TTS 通过利用先验样本的高质量韵律,实现韵律一致性,同时有效捕获目标说话人的声音特征。此外,它在微调期间采用先验保留损失,以保持对先验样本的合成能力,防止在目标样本上过拟合。大量实验表明,即使在样本数量有限且质量较差的情况下,Stable-TTS 依然有效。
引用
@article{arxiv.2412.20155,
title = {Stable-TTS: Stable Speaker-Adaptive Text-to-Speech Synthesis via Prosody Prompting},
author = {Wooseok Han and Minki Kang and Changhun Kim and Eunho Yang},
journal= {arXiv preprint arXiv:2412.20155},
year = {2024}
}
备注
Accepted by ICASSP 2025