ProsodyFM:面向可理解语音合成的无监督短语划分与语调控制
计算与语言
2024-12-20 v2 声音
音频与语音处理
摘要
韵律包含超越词语字面意义的丰富信息,对语音的可理解性至关重要。当前模型在短语划分和语调方面仍存在不足:合成具有复杂结构的长句时,不仅会遗漏或错放停顿,还会产生不自然的语调。我们提出ProsodyFM,一种基于流匹配(FM)主干、感知韵律的文本到语音合成(TTS)模型,旨在增强韵律的短语划分和语调方面。ProsodyFM引入两个关键组件:短语停顿编码器,用于捕获初始短语停顿位置,随后是持续时间预测器,用于灵活调整停顿持续时间;以及终端语调编码器,它学习一组语调形状标记,并结合新颖的音高处理器,以更稳健地建模人类感知的语调变化。ProsodyFM在训练时无需显式韵律标签,却能揭示广泛的停顿持续时间和语调模式。实验结果表明,与四种最先进(SOTA)模型相比,ProsodyFM能有效改善韵律的短语划分和语调方面,从而提升整体可理解性。分布外实验表明,这种韵律改进可进一步使ProsodyFM对未见过的复杂句子和说话人具有优越的泛化能力。我们的案例研究直观地展示了ProsodyFM在短语划分和语调上的强大且细粒度的可控性。
引用
@article{arxiv.2412.11795,
title = {ProsodyFM: Unsupervised Phrasing and Intonation Control for Intelligible Speech Synthesis},
author = {Xiangheng He and Junjie Chen and Zixing Zhang and Björn W. Schuller},
journal= {arXiv preprint arXiv:2412.11795},
year = {2024}
}
备注
Accepted by AAAI 2025