改变预训练文本到语音模型潜空间以提升表现力的研究
计算与语言
2023-11-21 v1 人工智能
摘要
本报告探讨了通过以联合语义音频/文本嵌入为条件的扩散模型增强冻结预训练模型,从而提升文本到语音(TTS)模型表现力控制能力的挑战。论文指出了使用基于 VAE 的 TTS 模型时所遇挑战,并评估了用于改变潜语音特征的不同图像到图像方法。我们的结果为向 TTS 系统添加表现力控制的复杂性提供了宝贵见解,并为该方向的未来研究开辟了路径。
引用
@article{arxiv.2311.10804,
title = {A Study on Altering the Latent Space of Pretrained Text to Speech Models for Improved Expressiveness},
author = {Mathias Vogel},
journal= {arXiv preprint arXiv:2311.10804},
year = {2023}
}