中文

MOSS-VoiceGenerator:使用自然语言描述创建逼真的语音

声音 2026-03-31 v1 人工智能 计算与语言

摘要

从自然语言生成语音设计旨在直接从自由形式的文本描述生成说话人语音,从而允许用户根据特定的角色、性格和情感创建量身定制的语音。这一可控语音创建受益于广泛的下游应用,包括故事讲述、游戏配音、角色扮演智能体和对话助手,因而是现代文本转语音模型的重要任务。然而,现有模型大多在精心录制的录音室数据上进行训练,产生的语音干净且发音清晰,却缺乏真实人声的生动感。为此,我们提出了 MOSS-VoiceGenerator,一个开源的指令驱动式语音生成模型,可直接从自然语言提示词创建新的语音。我们受到这样一个假设的启发:暴露于真实世界声学变异性可产生更具感知自然性的语音。我们在来自电影内容的大规模表现性语音数据上进行训练。主观偏好研究表明,其在整体性能、指令遵循和自然度方面均优于其他语音设计模型。

关键词

引用

@article{arxiv.2603.28086,
  title  = {MOSS-VoiceGenerator: Create Realistic Voices with Natural Language Descriptions},
  author = {Kexin Huang and Liwei Fan and Botian Jiang and Yaozhou Jiang and Qian Tu and Jie Zhu and Yuqian Zhang and Yiwei Zhao and Chenchen Yang and Zhaoye Fei and Shimin Li and Xiaogui Yang and Qinyuan Cheng and Xipeng Qiu},
  journal= {arXiv preprint arXiv:2603.28086},
  year   = {2026}
}