利用多模态语音产生数据评估视听语音合成中的发音动画
人机交互
2012-09-25 v1 图形学
摘要
为高质量视听 (AV) 语音合成对语音发音进行建模的重要性已得到广泛认可。然而,尽管最先进的数据驱动面部动画方法可以利用复杂的动作捕捉技术,但口腔内发音器官(即舌头、下颌和软腭)的动画通常仅使用简单规则或视位变形,这与 otherwise 高质量的面部建模形成鲜明对比。使用适当的语音产生数据可以显著提高 AV 合成中发音动画的质量。
引用
@article{arxiv.1209.4982,
title = {Using multimodal speech production data to evaluate articulatory animation for audiovisual speech synthesis},
author = {Ingmar Steiner and Korin Richmond and Slim Ouni},
journal= {arXiv preprint arXiv:1209.4982},
year = {2012}
}