4D 面部表情扩散模型
计算机视觉与模式识别
2024-04-16 v2
摘要
面部表情生成是角色动画中最具挑战性且长期被追求的问题之一,具有许多有趣的应用。这一传统上严重依赖数字工匠的挑战性任务,仍有待探索。本文中,我们引入一个生成式框架,用于生成 3D 面部表情序列(即 4D 人脸),其可以基于不同输入条件来驱动任意 3D 人脸网格的动画。它由两项任务组成:(1)学习在一组 3D landmark 序列上训练的生成模型;(2)由生成的 landmark 序列驱动,生成输入面部网格的 3D 网格序列。该生成模型基于去噪扩散概率模型(DDPM),其已在其他领域的生成任务中取得显著成功。虽然它可被无条件训练,其逆过程仍可由各种条件信号所条件化。这使我们能高效地开发涉及多种条件生成的下游任务,通过使用表情标签、文本、部分序列或仅一个面部几何。为获得完整网格形变,我们进而开发了一个 landmark 引导的编码器-解码器,以将 landmark 中嵌入的几何形变施加于给定面部网格。实验表明,我们的模型仅从相对小尺寸的数据集中便学会了生成逼真、高质量的表情,优于当前最优(SOTA)方法。与其他方法的视频及定性比较可见 \url{https://github.com/ZOUKaifeng/4DFM}。
引用
@article{arxiv.2303.16611,
title = {4D Facial Expression Diffusion Model},
author = {Kaifeng Zou and Sylvain Faisan and Boyang Yu and Sébastien Valette and Hyewon Seo},
journal= {arXiv preprint arXiv:2303.16611},
year = {2024}
}