VoiceStar: 具备时长控制与外推能力的鲁棒零样本自回归 TTS
音频与语音处理
2025-06-03 v2 声音
摘要
我们提出了 VoiceStar,这是首个同时实现输出时长控制与外推的零样本 TTS 模型。VoiceStar 是一种自回归编码器-解码器神经编解码器语言模型,它利用了新颖的进度监控旋转位置嵌入 (PM-RoPE) 并通过续写提示混合 (CPM) 训练进行训练。PM-RoPE 使模型能够更好地对齐文本与语音 token,指示生成语音的目标时长,并允许模型生成时长远超训练时所见的语音波形。CPM 训练也有助于缓解训练/推理不匹配问题,并在说话人相似性与可懂度方面显著提升生成语音的质量。VoiceStar 在 Librispeech 和 Seed-TTS 等短文本基准上优于或持平于当前 SOTA 模型,并在长文本/外推基准 (20-50秒) 上的可懂度与自然度方面显著优于这些模型。代码与模型:https://github.com/jasonppy/VoiceStar。音频样本:https://jasonppy.github.io/VoiceStar_web
引用
@article{arxiv.2505.19462,
title = {VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation},
author = {Puyuan Peng and Shang-Wen Li and Abdelrahman Mohamed and David Harwath},
journal= {arXiv preprint arXiv:2505.19462},
year = {2025}
}