3DFacePolicy:基于动作控制的音频驱动 3D 面部动画
计算机视觉与模式识别
2025-08-13 v2 人工智能
机器学习
多媒体
声音
音频与语音处理
摘要
音频驱动的 3D 面部动画在研究和应用中都取得了显著进展。由于最近的基线方法采用逐帧顶点生成方法,难以生成自然连续的面部运动,我们提出了 3DFacePolicy,这是一项先驱性工作,通过“动作”的概念引入了对连续帧间顶点轨迹变化的新颖定义。通过预测每个顶点编码帧间运动的动作序列,我们将顶点生成方法重新表述为基于动作的控制范式。具体而言,我们利用一种机器人控制机制——扩散策略,来预测以音频和顶点状态为条件的动作序列。在 VOCASET 和 BIWI 数据集上的大量实验表明,我们的方法显著优于现有最先进的方法,并且在动态、富有表现力且自然平滑的面部动画方面尤为擅长。
关键词
引用
@article{arxiv.2409.10848,
title = {3DFacePolicy: Audio-Driven 3D Facial Animation Based on Action Control},
author = {Xuanmeng Sha and Liyun Zhang and Tomohiro Mashita and Naoya Chiba and Yuki Uranishi},
journal= {arXiv preprint arXiv:2409.10848},
year = {2025}
}