中文

结合掩码语言模型和跨模态对比学习的语调感知 TTS

声音 2026-04-03 v1 音频与语音处理

摘要

我们研究了在扩散-based TTS 中进行语调建模的多阶段预训练方法。训练一个以说话人为条件的双流编码器,使用掩码语言模型,然后采用 SigLIP 风格的跨模态对比学习(使用混合音素批次),并单独研究额外的相同音素细化阶段。我们在 Grad-TTS 和潜在扩散 TTS 系统中评估了内在文本-音频检索和下游合成效果。两阶段课程(MLM + 混合音素对比学习)在可读性、说话人相似性和感知指标方面实现了最佳整体合成质量。尽管相同音素细化改进了语调检索,但会降低音素判别能力并损害合成效果。这些发现表明,嵌入空间指标的改进并不一定转化为更好的生成性能,凸显了在 TTS 预训练中平衡音素判别性和语调灵敏性的必要性。

关键词

引用

@article{arxiv.2604.01247,
  title  = {Combining Masked Language Modeling and Cross-Modal Contrastive Learning for Prosody-Aware TTS},
  author = {Kirill Borodin and Vasiliy Kudryavtsev and Maxim Maslov and Nikita Vasiliev and Mikhail Gorodnichev and Grach Mkrtchian},
  journal= {arXiv preprint arXiv:2604.01247},
  year   = {2026}
}

备注

This paper has been submitted to Interspeech 2026 for review