中文

VoiceCraft-X:统一多语言、语音克隆语音合成与语音编辑

音频与语音处理 2025-11-18 v1 计算与语言 声音

摘要

我们介绍 VoiceCraft-X,这是一个自回归神经编解码语言模型,统一了多语言语音编辑和零样文本到语音(TTS)合成,支持 11 种语言:英语、普通话、韩语、日语、西班牙语、法语、德语、荷兰语、意大利语、葡萄牙语和波兰语。VoiceCraft-X 利用 Qwen3 大型语言模型进行无音素的跨语言文本处理,并采用一种新颖的 token 重排序机制,以时间对齐的文本和语音 token 处理此两个任务作为单个序列生成问题。该模型生成高质量、自然的语音,无缝地在一个框架内创建新音频或编辑现有录音。VoiceCraft-X 在多样化的语言环境中表现出稳健的性能,即使在每个语言数据有限的情况下也能做到这一点,凸显了统一自回归方法在推进复杂现实世界多语言语音应用方面的强大能力。音频样本可在 https://zhishengzheng.com/voicecraft-x/ 查看。

关键词

引用

@article{arxiv.2511.12347,
  title  = {VoiceCraft-X: Unifying Multilingual, Voice-Cloning Speech Synthesis and Speech Editing},
  author = {Zhisheng Zheng and Puyuan Peng and Anuj Diwan and Cong Phuoc Huynh and Xiaohang Sun and Zhu Liu and Vimal Bhat and David Harwath},
  journal= {arXiv preprint arXiv:2511.12347},
  year   = {2025}
}

备注

EMNLP 2025. Demo and code are available at https://zhishengzheng.com/voicecraft-x/