基于音频与注视驱动的 Codec Avatars 面部动画
计算机视觉与模式识别
2020-08-13 v1
摘要
Codec Avatars 是近期一类习得性的照片级真实人脸模型,可准确表示人在 3D 中的几何与纹理(即用于虚拟现实),且几乎与视频无法区分。本文描述了第一种实时动画这些参数化模型的方法,其可利用音频和/或眼动追踪部署于商用虚拟现实硬件上。我们的目标仅从有损输入信号中的潜在线索出发,呈现展现笑声与兴奋等重要社交信号的生动人际对话。为此,我们采集了三名受试者超过 5 小时的高帧率 3D 人脸扫描,包括传统中性语音以及富有表现力与对话性的语音。我们研究了一种多模态融合方法,其动态识别任一时刻应由哪种传感器编码来驱动面部的哪些部分。请参阅补充视频,其展示了我们生成远超竞争工作中典型中性唇部动作的全脸运动的能力:https://research.fb.com/videos/audio-and-gaze-driven-facial-animation-of-codec-avatars/
引用
@article{arxiv.2008.05023,
title = {Audio- and Gaze-driven Facial Animation of Codec Avatars},
author = {Alexander Richard and Colin Lea and Shugao Ma and Juergen Gall and Fernando de la Torre and Yaser Sheikh},
journal= {arXiv preprint arXiv:2008.05023},
year = {2020}
}