MimicTalk:在分钟级内模拟个人化和表达性3D说话人脸
计算机视觉与模式识别
2024-10-16 v2
摘要
说话人脸生成(TFG)旨在使目标身份的面部动画以逼真的说话视频形式呈现。个人化TFG侧重于综合结果的感知身份相似性(从外观和说话风格的角度)。虽然前期工作通常通过为每个身份学习单个神经辐射场(NeRF)来隐式存储其静态和动态信息,但我们发现该方法效率低且不具通用性,因基于每个身份的训练框架及训练数据有限。为此,我们提出 MimicTalk,首次尝试利用基于NeRF的人类无关通用模型的丰富知识来提高个人化TFG的效率和鲁棒性。具体而言:(1)我们首先构建一个人类无关的3DTFG模型作为基础模型,并提出将其适配到特定身份;(2)我们提出一种静态-动态混合适配流程,帮助模型学习个性化的静态外观和面部动态特征;(3)为生成个性化说话风格的面部运动,我们提出一种基于情境的音频到运动模型,通过显式风格表示模拟参考视频中隐式提供的说话风格,实现信息无损传递。适配未知身份的过程仅需15分钟,速度是前人依赖方法的47倍。实验表明,MimicTalk 在视频质量、效率和表达性方面超越前人基线。源码和视频样本地址:https://mimictalk.github.io
引用
@article{arxiv.2410.06734,
title = {MimicTalk: Mimicking a personalized and expressive 3D talking face in minutes},
author = {Zhenhui Ye and Tianyun Zhong and Yi Ren and Ziyue Jiang and Jiawei Huang and Rongjie Huang and Jinglin Liu and Jinzheng He and Chen Zhang and Zehan Wang and Xize Chen and Xiang Yin and Zhou Zhao},
journal= {arXiv preprint arXiv:2410.06734},
year = {2024}
}
备注
Accepted by NeurIPS 2024