CosyVoice: 一种基于监督语义标记的可扩展多语言零样本文本转语音合成器
声音
2024-07-10 v2 人工智能
音频与语音处理
摘要
近年来,基于大语言模型(LLM)的文本转语音(TTS)技术因其高自然度和零样本能力而成为主流。在这种范式中,语音信号被离散化为标记序列,由LLM以文本为提示进行建模,并通过基于标记的声码器重建为波形。显然,语音标记在基于LLM的TTS模型中起着关键作用。当前的语音标记是以无监督方式学习的,缺乏明确的语义信息和与文本的对齐。在本文中,我们提出使用监督语义标记来表示语音,这些标记通过将向量量化插入编码器,从多语言语音识别模型中导出。基于这些标记,我们进一步提出了一种可扩展的零样本TTS合成器CosyVoice,它由一个用于文本到标记生成的LLM和一个用于标记到语音合成的条件流匹配模型组成。实验结果表明,在零样本语音克隆中,监督语义标记在内容一致性和说话人相似度方面显著优于现有的无监督标记。此外,我们发现利用大规模数据可以进一步提高合成性能,这表明了CosyVoice的可扩展能力。据我们所知,这是首次尝试将监督语音标记引入TTS模型。
引用
@article{arxiv.2407.05407,
title = {CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens},
author = {Zhihao Du and Qian Chen and Shiliang Zhang and Kai Hu and Heng Lu and Yexin Yang and Hangrui Hu and Siqi Zheng and Yue Gu and Ziyang Ma and Zhifu Gao and Zhijie Yan},
journal= {arXiv preprint arXiv:2407.05407},
year = {2024}
}
备注
work in progress. arXiv admin note: substantial text overlap with arXiv:2407.04051