中文

论基于扩散的文本到语音模型的语义潜在空间

声音 2024-06-05 v2 计算与语言 机器学习 音频与语音处理

摘要

去噪扩散模型(DDMs)在文本到语音(TTS)领域的应用日益增多,为合成高质量语音提供了巨大价值。尽管它们展现出令人印象深刻的音频质量,但其语义能力的程度尚不清楚,且控制其合成语音的声学特性仍然是一个挑战。受图像合成最新进展的启发,我们探索了冻结 TTS 模型的潜在空间,该空间由 DDM 去噪器的潜在瓶颈激活组成。我们发现该空间包含丰富的语义信息,并概述了在其中寻找语义方向的几种新颖方法,包括有监督和无监督方法。随后,我们展示了这些方法如何实现开箱即用的音频编辑,而无需任何进一步的训练、架构更改或数据要求。我们提供了关于编辑后音频的语义和声学质量的证据,并提供了补充样本:https://latent-analysis-grad-tts.github.io/speech-samples/。

关键词

引用

@article{arxiv.2402.12423,
  title  = {On the Semantic Latent Space of Diffusion-Based Text-to-Speech Models},
  author = {Miri Varshavsky-Hassid and Roy Hirsch and Regev Cohen and Tomer Golany and Daniel Freedman and Ehud Rivlin},
  journal= {arXiv preprint arXiv:2402.12423},
  year   = {2024}
}

备注

Accepted to ACL 2024