中文

端到端TTS中隐藏的上下文特征探究

机器学习 2019-02-26 v2 声音 音频与语音处理 机器学习

摘要

近期研究引入了端到端TTS,其将统计参数语音合成中上下文特征与声学特征的产生相整合。结果,单一神经网络以自动化特征学习替代了繁重的特征工程。然而,关于端到端TTS在合成语音前从文本输入中提取了何种类型的上下文信息,人们知之甚少,且关于上下文特征的既有知识几乎未被利用。在本工作中,我们首先指出端到端TTS与参数TTS之间的模型相似性。基于该相似性,我们依据源自参数TTS中使用的标准上下文信息集合的八项准则,评估端到端TTS系统编码器输出的质量。我们使用机器学习文献中新近开发的、用于神经网络表示定量分析的评估流程进行实验,同时将其适配至TTS领域。实验结果表明,编码器输出反映了语言与语音上下文,例如音素级的元音弱化、音节级的词汇重音以及词级的词性,这可能是由于上下文与声学特征的联合优化所致。

关键词

引用

@article{arxiv.1811.01376,
  title  = {Investigating context features hidden in End-to-End TTS},
  author = {Kohki Mametani and Tsuneo Kato and Seiichi Yamamoto},
  journal= {arXiv preprint arXiv:1811.01376},
  year   = {2019}
}

备注

Accepted to ICASSP 2019