HiStyle:面向文本提示引导可控语音合成的分层风格嵌入预测器
人工智能
2025-10-01 v1
摘要
可控语音合成是指通过操纵特定的韵律和副语言属性(如性别、音量、语速、音调和音调波动)来精确控制说话风格。随着先进生成模型,特别是大语言模型(LLM)和扩散模型的整合,可控文本到语音(TTS)系统已越来越多地从基于标签的控制转向基于自然语言描述的控制,这通常通过从文本提示预测全局风格嵌入来实现。然而,这种直接的预测忽略了风格嵌入的潜在分布,这可能阻碍可控 TTS 系统充分发挥其潜力。在本研究中,我们使用 t-SNE 分析对各种主流 TTS 系统的全局风格嵌入分布进行了可视化与分析,揭示了一个清晰的分层聚类模式:嵌入首先按音色聚类,随后基于风格属性细分为更精细的簇。基于这一观察,我们提出了 HiStyle,一种以文本提示为条件的分层预测风格嵌入的两阶段风格嵌入预测器,并进一步引入对比学习以帮助对齐文本和音频嵌入空间。此外,我们提出了一种风格标注策略,利用统计方法和人类听觉偏好的互补优势,为风格控制生成更准确且感知上更一致的文本提示。综合实验表明,应用于基础 TTS 模型时,HiStyle 在保持自然度和可懂度方面的高语音质量的同时,实现了比其他风格嵌入预测方法显著更优的风格可控性。音频样本可在 https://anonymous.4open.science/w/HiStyle-2517/ 获取。
引用
@article{arxiv.2509.25842,
title = {HiStyle: Hierarchical Style Embedding Predictor for Text-Prompt-Guided Controllable Speech Synthesis},
author = {Ziyu Zhang and Hanzhao Li and Jingbin Hu and Wenhao Li and Lei Xie},
journal= {arXiv preprint arXiv:2509.25842},
year = {2025}
}