中文

VoXtream2:具备动态说话速率控制的全流式语音合成

音频与语音处理 2026-03-17 v1 计算与语言 人机交互 机器学习 声音

摘要

全流式语音合成(TTS)对于交互式系统必须以最小延迟开始发音,同时保持可控性,以便在文本逐渐到达时进行控制。我们提出 VoXtream2,一个具备动态说话速率控制的零样本全流式 TTS 模型,可在说话过程中实时更新。VoXtream2 将持续状态分布匹配机制与无分类器引导跨条件信号相结合,以提高可控性和合成质量。Prompt-text 掩码启用无文本音频提示,消除对提示转录的需求。尽管模型较小且训练数据较少,在标准零样本基准和专门的说话速率测试集上,VoXtream2 实现了与公开基线相当的客观和主观结果。在全流模式下,VoXtream2 速度为实时速度的 4 倍,消费级 GPU 上实现 74 毫秒的首包延迟。

关键词

引用

@article{arxiv.2603.13518,
  title  = {VoXtream2: Full-stream TTS with dynamic speaking rate control},
  author = {Nikita Torgashov and Gustav Eje Henter and Gabriel Skantze},
  journal= {arXiv preprint arXiv:2603.13518},
  year   = {2026}
}

备注

10 pages, 9 figures, Submitted to Interspeech 2026