中文

改变预训练文本到语音模型潜空间以提升表现力的研究

计算与语言 2023-11-21 v1 人工智能

摘要

本报告探讨了通过以联合语义音频/文本嵌入为条件的扩散模型增强冻结预训练模型,从而提升文本到语音(TTS)模型表现力控制能力的挑战。论文指出了使用基于 VAE 的 TTS 模型时所遇挑战,并评估了用于改变潜语音特征的不同图像到图像方法。我们的结果为向 TTS 系统添加表现力控制的复杂性提供了宝贵见解,并为该方向的未来研究开辟了路径。

关键词

引用

@article{arxiv.2311.10804,
  title  = {A Study on Altering the Latent Space of Pretrained Text to Speech Models for Improved Expressiveness},
  author = {Mathias Vogel},
  journal= {arXiv preprint arXiv:2311.10804},
  year   = {2023}
}