中文

基于 MRI 发音表征的深度语音合成

音频与语音处理 2023-07-06 v1

摘要

本文研究发音合成,一种利用人声道信息的语音合成方法,其提供了开发高效、可泛化且可解释合成器的途径。尽管近期进展已能使用电磁发音描记术(EMA)实现可懂的发音合成,这些方法缺乏激励与鼻音等关键发音信息,限制了泛化能力。为弥补这一差距,我们提出一套替代性的基于 MRI 的特征集,其覆盖比 EMA 更广的发音空间。我们还引入归一化与去噪流程,以增强基于 MRI 数据训练的深度学习方法的泛化性。此外,我们提出一个 MRI 到语音的模型,提升了计算效率与语音保真度。最后,通过一系列消融实验,我们表明所提 MRI 表征比 EMA 更全面,并确定了最适用于发音合成的 MRI 特征子集。

关键词

引用

@article{arxiv.2307.02471,
  title  = {Deep Speech Synthesis from MRI-Based Articulatory Representations},
  author = {Peter Wu and Tingle Li and Yijing Lu and Yubin Zhang and Jiachen Lian and Alan W Black and Louis Goldstein and Shinji Watanabe and Gopala K. Anumanchipalli},
  journal= {arXiv preprint arXiv:2307.02471},
  year   = {2023}
}