HD-PPT:面向基于指令的 TTS 的内容与提示偏好令牌分层解码
音频与语音处理
2026-03-17 v2 声音
摘要
基于大语言模型(LLM)的文本转语音(TTS)模型已经达到了很高的自然度。然而,TTS推理的精确控制仍然具有挑战性。尽管提出了基于指令的文本转语音(Instruct-TTS)模型,但由于单层文本指令与多层语音令牌之间的模态鸿沟,这些模型仍然缺乏细粒度控制。为了解决这一局限性,我们提出了HD-PPT,一个将语音合成转化为结构化、分层任务的框架。为了实现细粒度控制,我们引入了一种新颖的语音编解码器,在自动语音识别(ASR)和跨语言音频文本预训练(CLAP)目标的监督下,从复杂的语音令牌中提取不同的提示偏好和内容偏好令牌。为了弥合这些令牌之间的模态鸿沟,我们提出了一种分层解码策略,其中LLM按结构化顺序生成令牌:首先是语义,其次是细粒度风格,最后是完整的声学表示。大量实验表明,这种分层范式显著提高了指令依从性,并实现了SOTA的自然度,验证了我们的方法在精确和可控语音合成方面的有效性。音频样本可在 https://xxh333.github.io/ 获取。
引用
@article{arxiv.2509.19001,
title = {HD-PPT: Hierarchical Decoding of Content- and Prompt-Preference Tokens for Instruction-based TTS},
author = {Sihang Nie and Xiaofen Xing and Jingyuan Xing and Baiji Liu and Xiangmin Xu},
journal= {arXiv preprint arXiv:2509.19001},
year = {2026}
}
备注
5 pages, 2 figures, 3 tables; Accepted to ICASSP2026(Oral)