一种结合CNN与LSTM的新型语音驱动唇形同步模型
声音
2022-05-03 v1 人工智能
计算机视觉与模式识别
图形学
音频与语音处理
摘要
生成与语音同步且自然的唇部运动是创建逼真虚拟角色最重要的任务之一。本文提出一种由一维卷积与LSTM组合的深度神经网络,从变长语音输入生成3D模板人脸模型的顶点位移。由3D唇形顶点运动表示的面部下半部分运动与输入语音一致。为增强网络对不同声音信号的鲁棒性,我们采用训练好的语音识别模型提取语音特征,并引入速度损失项以减少生成面部动画的抖动。我们录制了一系列中文成人说普通话的视频,并创建了新的语音-动画数据集以弥补此类公开数据的缺乏。定性与定量评估表明,我们的模型能够生成与语音同步的平滑自然唇部运动。
引用
@article{arxiv.2205.00916,
title = {A Novel Speech-Driven Lip-Sync Model with CNN and LSTM},
author = {Xiaohong Li and Xiang Wang and Kai Wang and Shiguo Lian},
journal= {arXiv preprint arXiv:2205.00916},
year = {2022}
}
备注
This paper has been published on CISP-BMEI 2021. See https://ieeexplore.ieee.org/document/9624360