中文

JoyVoice:用于人类化多说话人对话合成的长上下文条件

声音 2025-12-23 v1 音频与语音处理

摘要

大型语音生成模型正从单说话人、短句合成演进为多说话人、长对话生成。当前的长篇语音生成模型主要受限于二人、轮流交替的互动。为此,我们引入了 JoyVoice,一种新的 anthropomorphic 基础模型,旨在实现对最多八位说话人的灵活、无边界的合成。与传统的级联系统不同,JoyVoice 采用统一的 E2E-Transformer-DiT 架构,直接利用自回归隐藏表示作为扩散输入,实现整体端到端优化。我们进一步提出了以 12.5 Hz 低比特率运行的 MM-Tokenizer,其整合了多任务语义和 MMSE 损失,有效地建模了语义和声学信息。此外,该模型通过大规模数据扰动实现了稳健的文本前端处理。实验表明,JoyVoice 在多语言生成 (中文、英文、日文、韩文) 和零样素声克隆方面实现了最先进的效果。JoyVoice 在 Seed-TTS-Eval Benchmark 和多说话人长篇对话式语音克隆任务中均取得领先成绩,显示出卓越的音频质量和泛化能力。它在长篇语音的韵律连续性、多说话人对话的节奏丰富性、伴声自然度方面实现了显著提升,同时表现出优越的可理解性。我们鼓励读者访问 https://jea-speech.github.io/JoyVoice 聆听演示。

关键词

引用

@article{arxiv.2512.19090,
  title  = {JoyVoice: Long-Context Conditioning for Anthropomorphic Multi-Speaker Conversational Synthesis},
  author = {Fan Yu and Tao Wang and You Wu and Lin Zhu and Wei Deng and Weisheng Han and Wenchao Wang and Lin Hu and Xiangyu Liang and Xiaodong He and Yankun Huang and Yu Gu and Yuan Liu and Yuxuan Wang and Zhangyu Xiao and Ziteng Wang and Boya Dong and Feng Dang and Jinming Chen and Jingdong Li and Jun Wang and Yechen Jin and Yuan Zhang and Zhengyan Sheng and Xin Wang},
  journal= {arXiv preprint arXiv:2512.19090},
  year   = {2025}
}