CosyVoice 3:通过扩展规模与后训练实现野外语音生成
声音
2025-05-28 v2 人工智能
音频与语音处理
摘要
在我们之前的工作中,我们提出了一种可扩展的流式语音合成模型 CosyVoice 2,它集成了大型语言模型(LLM)和分块感知流匹配(FM)模型,实现了低延迟双流语音合成和类人质量。尽管取得了这些进展,CosyVoice 2 在语言覆盖、领域多样性、数据量、文本格式和后训练技术方面存在局限性。在本文中,我们提出了 CosyVoice 3,一个改进的模型,专为零样本多语言野外语音合成而设计,在内容一致性、说话人相似度和韵律自然度方面超越了其前身。CosyVoice 3 的关键特性包括:1)一种新型语音标记器,通过监督多任务训练(包括自动语音识别、语音情感识别、语言识别、音频事件检测和说话人分析)开发,以提高韵律自然度。2)一种新的可用于后训练的可微分奖励模型,不仅适用于 CosyVoice 3,也适用于其他基于 LLM 的语音合成模型。3)数据集规模扩展:训练数据从一万小时扩展到一百万小时,涵盖 9 种语言和 18 种中文方言,涉及各种领域和文本格式。4)模型规模扩展:模型参数从 5 亿增加到 15 亿,由于更大的模型容量,在多语言基准测试中实现了增强的性能。这些进展显著推动了野外语音合成的发展。我们鼓励读者访问 https://funaudiollm.github.io/cosyvoice3 聆听演示。
引用
@article{arxiv.2505.17589,
title = {CosyVoice 3: Towards In-the-wild Speech Generation via Scaling-up and Post-training},
author = {Zhihao Du and Changfeng Gao and Yuxuan Wang and Fan Yu and Tianyu Zhao and Hao Wang and Xiang Lv and Hui Wang and Chongjia Ni and Xian Shi and Keyu An and Guanrou Yang and Yabin Li and Yanni Chen and Zhifu Gao and Qian Chen and Yue Gu and Mengzhe Chen and Yafeng Chen and Shiliang Zhang and Wen Wang and Jieping Ye},
journal= {arXiv preprint arXiv:2505.17589},
year = {2025}
}
备注
Preprint, work in progress