中文

利用多模态语音产生数据评估视听语音合成中的发音动画

人机交互 2012-09-25 v1 图形学

摘要

为高质量视听 (AV) 语音合成对语音发音进行建模的重要性已得到广泛认可。然而,尽管最先进的数据驱动面部动画方法可以利用复杂的动作捕捉技术,但口腔内发音器官(即舌头、下颌和软腭)的动画通常仅使用简单规则或视位变形,这与 otherwise 高质量的面部建模形成鲜明对比。使用适当的语音产生数据可以显著提高 AV 合成中发音动画的质量。

关键词

引用

@article{arxiv.1209.4982,
  title  = {Using multimodal speech production data to evaluate articulatory animation for audiovisual speech synthesis},
  author = {Ingmar Steiner and Korin Richmond and Slim Ouni},
  journal= {arXiv preprint arXiv:1209.4982},
  year   = {2012}
}