中文

情感一致语音数据增强与自监督对比式风格训练以提升儿童故事语音合成

声音 2026-02-12 v1 音频与语音处理

摘要

表达式语音合成需要充满活力的韵律和恰当的停顿。我们提出一种有效策略,将小型数据集扩充以训练表达式端到端文本语音合成模型。我们整合具有情感一致性的文本音频,创建增强的表达式语音数据。通过训练双句音频,模型学习自然的行间停顿。我们进一步应用自监督对比训练,以改进说话风格嵌入从语音中的提取。在推理期间,模型以文本预测的说话风格为指引,一步生成多句语音。评估表明,我们的方法在与基于连续双句音频训练的基线模型进行比较时效果显著。我们的合成语音给出更接近真实语音的句间停顿分布。主观评估显示,我们的合成语音在自然性和风格适当性方面得分更高。

关键词

引用

@article{arxiv.2602.10164,
  title  = {Emotion-Coherent Speech Data Augmentation and Self-Supervised Contrastive Style Training for Enhancing Kids's Story Speech Synthesis},
  author = {Raymond Chung},
  journal= {arXiv preprint arXiv:2602.10164},
  year   = {2026}
}

备注

Accepted at IEEE Spoken Language Technology Workshop 2024