中文

VITA-QinYu:面向角色扮演与歌唱的表达性口语语言模型

计算与语言 2026-05-11 v1 人工智能

摘要

人类语言表达包含语言内容之外的表达性元素,包括性格、情绪或演出元素,如温柔的语调或伴唱歌曲,这些我们形式化地定义为角色扮演和歌唱。我们提出 VITA-QinYu,这是首个支持角色扮演和歌唱生成的端到端(E2E)口语语言模型(SLM),其功能超越了自然对话。VITA-QinYu 采用混合语音-文本范式,通过多码本音频标记扩展交错文本-音频建模,设计上既能实现更丰富的语义表示,又能保持模态间的清晰分离,以避免相互干扰。我们进一步开发了完整的数据生成管道,用于训练合成 15.8K 小时自然对话、角色扮演和歌唱数据。VITA-QinYu 在表达性方面表现优越, 在目标角色扮演基准测试中超越同行 SLM 高出 7 个百分点,在歌唱 5 分 MOS 量表上超越同行模型 0.13 分。同时,它在对话准确性和流畅性方面实现了状态最佳水平,分别在 C3 和 URO 基准测试中超越先前的 SLM 高出 1.38 和 4.98 个百分点。我们开源代码和模型,并提供一个支持流式和全双工交互的易用演示。

关键词

引用

@article{arxiv.2605.06765,
  title  = {VITA-QinYu: Expressive Spoken Language Model for Role-Playing and Singing},
  author = {Jiacheng Xu and Heting Gao and Liufei Xie and Zhenchuan Yang and Lijiang Li and Yiting Chen and Bin Zhang and Meng Chen and Chaoyu Fu and Weifeng Zhao and Wenjiang Zhou},
  journal= {arXiv preprint arXiv:2605.06765},
  year   = {2026}
}

备注

https://tme-lyra-lab.github.io/VITA-QinYu/