中文

用于映射功能韵律原型上下文敏感变化的变分韵律模型

音频与语音处理 2019-03-19 v2 声音

摘要

寻求将语言学和副语言功能与韵律形式联系起来的综合性语调生成模型,一直是语音通信研究中的长期挑战。传统语调模型已被深度学习(DL)技术的压倒性性能所取代,后者使用数百万可调节参数训练通用端到端映射。然而,向黑盒机器学习模型的转变带来了相反的问题——对发现知识、解释、可视化和解读的迫切需求。我们的工作架起了综合性语调生成模型与最先进 DL 技术之间的桥梁。我们基于功能轮廓叠加(SFC)模型的建模范式,提出变分韵律模型(VPM),该模型使用变分轮廓生成器网络来捕获组成性基本韵律轮廓的上下文敏感变化。我们表明,VPM 可以通过学习有意义的韵律潜空间表示结构,洞察这些韵律原型的内在变异性。我们还表明,VPM 能够捕获具有多维度上下文相关可变性的韵律现象。由于基于叠加原理,VPM 无需使用专门构建的语料库进行分析,从而开启了使用大数据进行韵律分析的可能性。在语音合成场景中,该模型可用于生成动态且自然的、无平均效应的韵律轮廓。

关键词

引用

@article{arxiv.1806.08685,
  title  = {A Variational Prosody Model for Mapping the Context-Sensitive Variation of Functional Prosodic Prototypes},
  author = {Branislav Gerazov and Gérard Bailly and Omar Mohammed and Yi Xu and Philip N. Garner},
  journal= {arXiv preprint arXiv:1806.08685},
  year   = {2019}
}

备注

Updated with recurrent version of contour generators, unified prosodic latent space, and performance evaluation with baseline