BASE TTS:构建千亿参数文本语音模型的经验教训
机器学习
2024-02-16 v2 计算与语言
音频与语音处理
摘要
我们介绍了一种名为 BASE TTS 的文本语音模型,全称是 ig daptive treamable TTS with mergent abilities。BASE TTS 是目前规模最大的文本语音模型,训练于 100K 小时公共领域语音数据,实现了语音自然度的新纪录。它采用 100 亿参数的自回归 Transformer,将原始文本转换为离散语音编码("speechcodes"),随后通过卷积解码器以递增、可流式的方式将这些 speechcodes 转换为波形。进一步地,我们的语音编码采用新颖的语音分词技术,特点包括说话人 ID 无缝分离和基于字节对编码的压缩。呼应大语言模型在数据量不断增加时表现出的"涌现能力",我们展示了 BASE TTS 变体在 10K+ 小时和 5 亿+ 参数时,开始在文本复杂句子中展现自然的韵律。我们设计并共享了一个专门用于衡量文本语音涌现能力的数据集。通过对比包括 YourTTS、Bark 和 TortoiseTTS 等公开的大规模文本语音系统于基线测试,我们展示了 BASE TTS 的最先进自然度。该模型生成的音频样本可在 https://amazon-ltts-paper.com/ 听取。
关键词
引用
@article{arxiv.2402.08093,
title = {BASE TTS: Lessons from building a billion-parameter Text-to-Speech model on 100K hours of data},
author = {Mateusz Łajszczak and Guillermo Cámbara and Yang Li and Fatih Beyhan and Arent van Korlaar and Fan Yang and Arnaud Joly and Álvaro Martín-Cortinas and Ammar Abbas and Adam Michalski and Alexis Moinet and Sri Karlapati and Ewa Muszyńska and Haohan Guo and Bartosz Putrycz and Soledad López Gambino and Kayeon Yoo and Elena Sokolova and Thomas Drugman},
journal= {arXiv preprint arXiv:2402.08093},
year = {2024}
}
备注
v1.1 (fixed typos)