基于每词隐扩散的连续特征语音合成
音频与语音处理
2025-11-25 v2
摘要
我们提出了 SALAD,这是一个基于连续语音表示的零样素语音自动生成模型。SALAD 利用每词扩散过程来细化和预测下一个时间步的连续表示。我们将方法与 SALAD 的离散变体以及公开可用的零样素语音系统进行比较,并对离散建模与连续建模技术进行了全面分析。我们的结果表明,SALAD 在保持语音质量和说话人相似性与真实音频相当的同时,实现了卓越的语音可理解性。
引用
@article{arxiv.2410.16048,
title = {Speech Synthesis From Continuous Features Using Per-Token Latent Diffusion},
author = {Arnon Turetzky and Avihu Dekel and Nimrod Shabtay and Slava Shechtman and David Haws and Hagai Aronowitz and Ron Hoory and Yossi Adi},
journal= {arXiv preprint arXiv:2410.16048},
year = {2025}
}
备注
ASRU 2025