中文

Mega-TTS 2:增强零样本语音合成的提示机制

音频与语音处理 2024-04-11 v4 声音

摘要

零样本文本转语音(TTS)旨在利用未见过的语音提示合成声音,其通过跳过微调过程显著降低了语音克隆的数据与计算需求。然而,零样本 TTS 的提示机制在以下方面仍面临挑战:1)以往的零样本 TTS 工作通常使用单句提示进行训练,这在推理阶段数据相对充足时严重限制了其性能。2)提示中的韵律信息与音色高度耦合,使其无法相互迁移。本文引入 Mega-TTS 2,一种面向零样本 TTS 的通用提示机制,以应对上述挑战。具体而言,我们设计了一个强大的声学自动编码器,将韵律和音色信息分别编码到压缩潜空间中,同时提供高质量重建。然后,我们提出了一个多参考音色编码器和一个韵律潜语言模型(P-LLM)以从多句提示中提取有用信息。我们进一步利用多个 P-LLM 输出导出的概率来生成可迁移且可控的韵律。实验结果表明,Mega-TTS 2 不仅能以任意来源的未见说话人的短提示合成保持身份的语音,而且在数据量从 10 秒到 5 分钟的范围内持续优于微调方法。此外,我们的方法能够以细粒度且可控的方式将多种说话风格迁移到目标音色。音频样本见 https://boostprompt.github.io/boostprompt/。

关键词

引用

@article{arxiv.2307.07218,
  title  = {Mega-TTS 2: Boosting Prompting Mechanisms for Zero-Shot Speech Synthesis},
  author = {Ziyue Jiang and Jinglin Liu and Yi Ren and Jinzheng He and Zhenhui Ye and Shengpeng Ji and Qian Yang and Chen Zhang and Pengfei Wei and Chunfeng Wang and Xiang Yin and Zejun Ma and Zhou Zhao},
  journal= {arXiv preprint arXiv:2307.07218},
  year   = {2024}
}

备注

Accepted by ICLR 2024