SponTTS:面向 TTS 的自发风格建模与迁移
声音
2024-01-09 v2 音频与语音处理
摘要
自发说话风格由于各种自发现象(例如,填充停顿、延长)和显著的韵律变化(例如,多样的音高与时长变化、偶尔的非言语语音如微笑),与其他说话风格存在显著差异,给自发风格的建模与预测带来挑战。此外,高质量自发数据的限制制约了无自发数据的说话人的自发语音生成。为解决这些问题,我们提出 SponTTS,一种基于神经瓶颈(BN)特征的两阶段方法,用于 TTS 的自发风格建模与迁移。在第一阶段,我们采用条件变分自编码器(CVAE)从 BN 特征中捕获自发韵律,并通过自发现象嵌入预测损失的约束来引入自发现象。此外,我们引入基于流的预测器,从文本中预测潜在的自发风格表示,从而在推理时丰富韵律与上下文特定的自发现象。在第二阶段,我们采用类 VITS 模块将第一阶段学到的自发风格迁移至目标说话人。实验表明,SponTTS 在建模自发风格及将该风格迁移至目标说话人方面是有效的,可生成具有高自然度、表现力与说话人相似度的自发语音。零样本自发风格 TTS 测试进一步验证了 SponTTS 在为未见说话人生成自发语音方面的泛化性与鲁棒性。
引用
@article{arxiv.2311.07179,
title = {SponTTS: modeling and transferring spontaneous style for TTS},
author = {Hanzhao Li and Xinfa Zhu and Liumeng Xue and Yang Song and Yunlin Chen and Lei Xie},
journal= {arXiv preprint arXiv:2311.07179},
year = {2024}
}
备注
5 pages, 3 figures, Accepted by ICASSP2024