中文

Seed-TTS:一系列高质量多功能语音生成模型

音频与语音处理 2024-06-05 v1 声音

摘要

我们介绍Seed-TTS,一系列大规模自回归文本到语音(TTS)模型,能够生成几乎与人类语音无法区分的语音。Seed-TTS作为语音生成的基础模型,在语音上下文学习方面表现出色,在客观和主观评估中均达到了与真实人类语音相匹配的说话人相似度和自然度性能。通过微调,我们在这些指标上获得了更高的主观分数。Seed-TTS对各种语音属性(如情感)提供了卓越的可控性,并且能够为野外说话人生成高度富有表现力和多样化的语音。此外,我们提出了一种用于语音分解的自蒸馏方法,以及一种用于增强模型鲁棒性、说话人相似度和可控性的强化学习方法。我们还提出了Seed-TTS模型的非自回归(NAR)变体,名为Seed-TTSDiT\text{Seed-TTS}_\text{DiT},它采用完全基于扩散的架构。与之前的基于NAR的TTS系统不同,Seed-TTSDiT\text{Seed-TTS}_\text{DiT}不依赖于预先估计的音素时长,而是通过端到端处理进行语音生成。我们证明该变体实现了与基于语言模型的变体相当的性能,并展示了其在语音编辑中的有效性。我们鼓励读者访问\url{https://bytedancespeech.github.io/seedtts_tech_report}收听演示。

关键词

引用

@article{arxiv.2406.02430,
  title  = {Seed-TTS: A Family of High-Quality Versatile Speech Generation Models},
  author = {Philip Anastassiou and Jiawei Chen and Jitong Chen and Yuanzhe Chen and Zhuo Chen and Ziyi Chen and Jian Cong and Lelai Deng and Chuang Ding and Lu Gao and Mingqing Gong and Peisong Huang and Qingqing Huang and Zhiying Huang and Yuanyuan Huo and Dongya Jia and Chumin Li and Feiya Li and Hui Li and Jiaxin Li and Xiaoyang Li and Xingxing Li and Lin Liu and Shouda Liu and Sichao Liu and Xudong Liu and Yuchen Liu and Zhengxi Liu and Lu Lu and Junjie Pan and Xin Wang and Yuping Wang and Yuxuan Wang and Zhen Wei and Jian Wu and Chao Yao and Yifeng Yang and Yuanhao Yi and Junteng Zhang and Qidi Zhang and Shuo Zhang and Wenjie Zhang and Yang Zhang and Zilin Zhao and Dejian Zhong and Xiaobin Zhuang},
  journal= {arXiv preprint arXiv:2406.02430},
  year   = {2024}
}