高效零样文本到语音合成的准自回归神经编解码语言模型
音频与语音处理
2025-08-06 v3 计算与语言
摘要
近期的零样文本到语音(TTS)系统面临普遍困境:自回归(AR)模型生成缓慢且缺乏时长可控性,而非自回归(NAR)模型则缺乏时序建模且通常需要复杂设计。本文引入一种新型准自回归(PAR)编解码语言建模方法,统一 AR 与 NAR 的建模。PAR 将 AR 的显式时序建模与 NAR 的并行生成相结合,在固定时间步长下生成动态长度跨度。基于 PAR,我们提出 PALLE,一个两阶段 TTS 系统,利用 PAR 完成初始生成,随后进行 NAR 精炼。在第一阶段,PAR 沿时间维逐步生成语音标记,每个步骤并行预测所有位置,但仅保留最左侧跨度。在第二阶段,针对低置信度标记进行并行迭代精炼,利用全局上下文信息。实验表明,PALLE 在 LibriTTS 上训练的模型,在 LibriSpeech test-clean 集合上,相较于 F5-TTS、E2-TTS 和 MaskGCT 等最新大规模数据训练的系统,在语音质量、说话人相似度和可读性方面均表现更佳,同时实现了最高十倍的推理速度加速。音频样本可在 https://microsoft.com/research/project/vall-e-x/palle 查看。
引用
@article{arxiv.2504.10352,
title = {Pseudo-Autoregressive Neural Codec Language Models for Efficient Zero-Shot Text-to-Speech Synthesis},
author = {Yifan Yang and Shujie Liu and Jinyu Li and Yuxuan Hu and Haibin Wu and Hui Wang and Jianwei Yu and Lingwei Meng and Haiyang Sun and Yanqing Liu and Yan Lu and Kai Yu and Xie Chen},
journal= {arXiv preprint arXiv:2504.10352},
year = {2025}
}
备注
Accepted in ACMMM 2025