中文

KALL-E:基于下一分布预测的自回归语音合成

音频与语音处理 2025-09-18 v2 计算与语言 声音

摘要

我们介绍KALL-E,这是一种新型自回归(AR)语言模型,用于文本到语音(TTS)合成,其通过预测连续语音帧的下一个分布来实现。与现有方法不同,KALL-E直接建模以文本为条件的连续语音分布,无需任何扩散-based 组件。具体而言,我们利用Flow-VAE从波形中提取连续潜在语音表示,而非依赖离散语音标记。随后,在文本上训练一个单一的AR Transformer,以预测这些连续语音分布,优化Kullback-Leibler散度损失作为目标。实验结果表明,KALL-E在语音合成质量方面取得优越成绩,甚至可以仅通过一个样本即可适配目标说话人。重要的是,KALL-E为在TTS中利用连续语音表示提供了更直接且更有效的方法。

关键词

引用

@article{arxiv.2412.16846,
  title  = {KALL-E:Autoregressive Speech Synthesis with Next-Distribution Prediction},
  author = {Kangxiang Xia and Xinfa Zhu and Jixun Yao and Wenjie Tian and Wenhao Li and Lei Xie},
  journal= {arXiv preprint arXiv:2412.16846},
  year   = {2025}
}

备注

6 figures, 5 tables