使用F0的无监督离散表示感知语音合成中的韵律变化
音频与语音处理
2020-11-04 v1 计算与语言
机器学习
声音
机器学习
摘要
在英语中,韵律为音段序列增加了广泛的信息,从信息结构(如对比)到风格变化(如情感表达)。然而,在学习控制文本到语音声音中的韵律时,尚不清楚控制究竟在修改什么。现有关于韵律离散表示学习的研究已显示出高自然度,但尚未分析这些表示捕获了什么,或者它们是否能生成有意义的语句变体。我们提出了一个具有多模态先验的短语级变分自编码器,使用模式中心作为“语调编码”。我们的评估确定了哪些语调编码在感知上是不同的,发现来自多模态潜在模型的语调编码显著优于使用k-means聚类的基线。我们进行了后续定性研究,以确定这些编码携带了什么信息。最常见的是,听众评论语调编码具有陈述或疑问风格。然而,也报告了许多其他与情感相关的风格,包括:情绪化、不确定、惊讶、讽刺、被动攻击和沮丧。
引用
@article{arxiv.2003.06686,
title = {Perception of prosodic variation for speech synthesis using an unsupervised discrete representation of F0},
author = {Zack Hodari and Catherine Lai and Simon King},
journal= {arXiv preprint arXiv:2003.06686},
year = {2020}
}
备注
Published to the 10th ISCA International Conference on Speech Prosody (SP2020)