统计语音合成中韵律的层次化表示
计算与语言
2015-10-08 v1 声音
摘要
突显和边界是语音中韵律结构的基本组成部分。它们通过将相对显著性和在连贯话语结构内划分界限的方式,将语音流切分为语言学相关单元。突显和边界已广泛应用于韵律基础研究以及文本到语音合成中。然而,目前尚无能够以统一方式对二者进行估计和建模的表示方案。本文提出一种无监督统一描述,利用基于连续小波变换的尺度空间分析来估计和表示韵律突显与边界。使用波士顿大学广播新闻语料库(Boston University Radio News corpus)对方法进行了评估并与早期工作比较。结果表明,所提方法与已发表的最佳有监督标注方法相当。
引用
@article{arxiv.1510.01949,
title = {Hierarchical Representation of Prosody for Statistical Speech Synthesis},
author = {Antti Suni and Daniel Aalto and Martti Vainio},
journal= {arXiv preprint arXiv:1510.01949},
year = {2015}
}
备注
22 pages, 5 figures