中文

可控表现力语音合成背后的理论:一种跨学科方法

音频与语音处理 2019-10-15 v1 人机交互 机器学习 声音

摘要

作为人机交互领域的一部分,表现力语音合成是一个极为丰富的领域,因为它需要机器学习、信号处理、社会学、心理学等领域的知识。在本章中,我们将主要关注技术层面。从表现力语音的录制到其建模,读者将通过一些最突出的系统与方法概览该领域使用的主要范式。我们解释语音如何用音频特征表示与编码。我们介绍主要文本到语音合成方法的历史:拼接式、参数式与统计参数语音合成。最后,我们聚焦于最后一种,其最新技术将文本到语音合成建模为序列到序列问题。这使得卷积与循环神经网络以及注意力机制等深度学习模块得以使用。本章最后部分旨在汇集理论的各个方面并总结这些概念。

关键词

引用

@article{arxiv.1910.06234,
  title  = {The Theory behind Controllable Expressive Speech Synthesis: a Cross-disciplinary Approach},
  author = {Noé Tits and Kevin El Haddad and Thierry Dutoit},
  journal= {arXiv preprint arXiv:1910.06234},
  year   = {2019}
}

备注

19 pages, 6 figures. To be published in the book "Human Computer Interaction" edited by Prof. Yves Rybarczyk, published by IntechOpen