中文

CapTalk:用于单句和对话语音生成的统一语音设计

声音 2026-04-10 v1

摘要

从自然语言描述进行语音设计正在成为文本到语音多模态生成中的新任务,旨在无需参考音频即可合成具有目标时长和说话风格的语音。然而,现有方法主要关注单句生成,留给对话语音设计很大发展空间。本文将语音设计扩展到对话场景,实现更精准的目标说话者建模和自然对话环境中的句子级表达控制。我们提出 CapTalk,一个统一的以描述为导引的文本-音频自回归框架,用于单句和对话语音设计。CapTalk 采用句子级描述实现单句语音设计,采用说话者级描述实现对话说话者建模,并进一步引入对话中的 CoT 控制序列,以明确规划句子级动态属性。在稳定时长保持与情境自适应表达之间解决冲突方面,我们提出了带有句子级说话者编码器的层次化可变条件模块,以更好地平衡稳定时长保持与情境自适应表达。这实现了时长复用,同时保持对当前句子以及对话中上下文环境的表达自适应。我们还构建了一个涵盖单句和对话场景的全面评估协议。实验表明,CapTalk 在单句语音设计基准上实现了最先进的性能,并在多轮对话中实现了更好的表达可控性和情境恰当性。音频样本可在:https://anonymous.4open.science/api/repo/Captalk-D601/file/index.html 查看。

关键词

引用

@article{arxiv.2604.08363,
  title  = {CapTalk: Unified Voice Design for Single-Utterance and Dialogue Speech Generation},
  author = {Xiaosu Su and Zihan Sun and Peilei Jia and Jun Gao},
  journal= {arXiv preprint arXiv:2604.08363},
  year   = {2026}
}

备注

14 pages, 2 figures