基于链式细节的文本转语音:建模语音生成中的时序动力学
音频与语音处理
2026-04-30 v2
摘要
最近的文本转语音 (TTS) 合成技术取得了进展,采用多阶段方法,首先预测语义标记,再生成声学标记。本文将粗到细生成范式扩展至时序域,引入链式细节 (Chain-of-Details, CoD),这是一种新型框架,通过级联架构显式建模语音生成中的时序粗到细动力学。该方法在多个阶段逐步细化时序细节,每个阶段针对特定的时序粒度进行优化。所有时序细节预测均使用共享解码器完成,实现了在不同时序分辨率之间的高效参数利用。值得注意的是,最低细节层天然完成语音规划,无需显式的音素时长预测器。我们在多个数据集上评估了该方法,并与多个基线方法进行比较。实验结果表明,CoD 以显著更少的参数实现了与现有方法相当的性能。我们的发现表明,采用 CoD 框架对时序动力学进行显式建模,能够实现更自然的语音合成。
引用
@article{arxiv.2604.19330,
title = {Text-To-Speech with Chain-of-Details: modeling temporal dynamics in speech generation},
author = {Jianbo Ma and Richard Cartwright},
journal= {arXiv preprint arXiv:2604.19330},
year = {2026}
}