通过 SSML 语音乐器控制提升法语合成语音质量
计算与语言
2025-08-26 v1 声音
摘要
尽管近期进步显著,但合成语音常因商业文本转语音系统中语音韵律控制有限而缺乏表达性。我们介绍首个面向法语文本插入语音合成标记语言 (SSML) 标签以控制音高、语速、音量和停顿时长的端到端管道。我们采用包含两个 QLoRA 微调 Qwen 2.5-7B 模型的级联架构:一个预测短语断点位置,另一个对语音韵律目标进行回归,生成兼容商业 TTS 的 SSML 标记。在 14 小时的法语播客语料库上评估,我们的方法在断点放置上达到 99.2% F1 分数,并将音高、语速和音量的平均绝对误差较仅使用提示的大型语言模型 (LLM) 和 BiLSTM 基线降低 25-40%。在包含 18 名听者的感知评估中,超过 9 小时的合成音频显示,SSML 增强语音显著提升了自然度,平均意见分从 3.20 提升至 3.87(p < 0.005)。此外,15 位听者偏好我们的增强合成。这些结果显示我们在弥合合成语音与自然法语语音的表达性差距方面取得了显著进展。我们的代码已公开于 https://github.com/hi-paris/Prosody-Control-French-TTS。
关键词
引用
@article{arxiv.2508.17494,
title = {Improving French Synthetic Speech Quality via SSML Prosody Control},
author = {Nassima Ould Ouali and Awais Hussain Sani and Ruben Bueno and Jonah Dauvet and Tim Luka Horstmann and Eric Moulines},
journal= {arXiv preprint arXiv:2508.17494},
year = {2025}
}
备注
13 pages, 9 figures, 6 tables. Accepted for presentation at ICNLSP 2025 (Odense, Denmark). Code and demo: https://github.com/hi-paris/Prosody-Control-French-TTS. ACM Class: I.2.7; H.5.5