中文

用于神经文本转语音高效采样的离散声学空间

声音 2023-09-15 v3 机器学习 音频与语音处理

摘要

我们提出了一种用于 NTTS 的分割向量量化变分自编码器 (SVQ-VAE) 架构,采用分割向量量化器,作为对著名变分自编码器 (VAE) 与向量量化变分自编码器 (VQ-VAE) 架构的增强。与这些先前架构相比,我们提出的模型保留了使用语句级瓶颈的好处,同时保持显著的表示能力,以及足够小以便从文本高效预测的离散潜空间。我们在表达性面向任务对话域的录音上训练模型,并表明 SVQ-VAE 在自然度上相较 VAE 与 VQ-VAE 模型取得了统计显著的提升。此外,我们证明 SVQ-VAE 的潜声学空间可从文本预测,将标准常量向量合成与声码器录音之间的差距缩小了 32%。

关键词

引用

@article{arxiv.2110.12539,
  title  = {Discrete Acoustic Space for an Efficient Sampling in Neural Text-To-Speech},
  author = {Marek Strong and Jonas Rohnke and Antonio Bonafonte and Mateusz Łajszczak and Trevor Wood},
  journal= {arXiv preprint arXiv:2110.12539},
  year   = {2023}
}

备注

5 pages, 5 figures, accepted at IberSPEECH 2022