面向语音合成的随机单调对齐连续自回归建模
机器学习
2025-02-14 v2 声音
音频与语音处理
摘要
我们提出了一种新颖的语音合成自回归建模方法,该方法结合了变分自编码器(VAE)与多模态潜空间,以及使用高斯混合模型(GMM)作为条件概率分布的自回归模型。与以往依赖残差矢量量化的方法不同,我们的模型利用来自 VAE 潜空间的连续语音表示,极大地简化了训练和推理流程。我们还引入了一种随机单调对齐机制,以强制实现严格的单调对齐。我们的方法在主观和客观评估中均显著优于最先进的自回归模型 VALL-E,且仅用 VALL-E 10.3% 的参数就取得了这些结果。这证明了连续语音语言模型作为现有基于量化的语音语言模型更高效替代方案的潜力。音频样本可在 https://tinyurl.com/gmm-lm-tts 找到。
引用
@article{arxiv.2502.01084,
title = {Continuous Autoregressive Modeling with Stochastic Monotonic Alignment for Speech Synthesis},
author = {Weiwei Lin and Chenghan He},
journal= {arXiv preprint arXiv:2502.01084},
year = {2025}
}
备注
ICLR 2025