MMHead:面向细粒度多模态 3D 人脸动画的文本引导方法
计算机视觉与模式识别
2024-10-11 v1
摘要
3D 人脸动画因其在多媒体领域的广泛应用而受到广泛关注。虽然音频驱动的 3D 人脸动画已取得显著成果,但多模态 3D 人脸动画(尤其是文本引导的 3D 人脸动画)鲜有探索,主要因缺乏多模态 3D 人脸动画数据集。为填补这一空白,我们首先构建了一个大规模多模态 3D 人脸动画数据集 MMHead,包含 49 小时的 3D 人脸动作序列、语音音频以及丰富的层次化文本标注。每个文本标注包含抽象的动作和情绪描述、细粒度的人脸和头部运动(即表情和头部姿态)描述,以及可能导致此类情绪的三种情景。具体而言,我们整合了五个公开的 2D 人脸视频数据集,并提出了一个自动化管道来 1) 从单目视频重建 3D 人脸动作序列;和 2) 通过 AU 检测和 ChatGPT 获取层次化文本标注。基于 MMHead 数据集,我们为两个新任务建立了基准:文本引导的 3D 说话人动画和文本到 3D 人脸动作生成。此外,提出了一种简单而高效基于 VQ-VAE 的方法 MM2Face,用于统一多模态信息并生成多样且合理的 3D 人脸动作,在两个基准上均取得优异成绩。大量实验和全面分析表明,我们的数据集和基准在推动多模态 3D 人脸动画发展方面具有显著潜力。
关键词
引用
@article{arxiv.2410.07757,
title = {MMHead: Towards Fine-grained Multi-modal 3D Facial Animation},
author = {Sijing Wu and Yunhao Li and Yichao Yan and Huiyu Duan and Ziwei Liu and Guangtao Zhai},
journal= {arXiv preprint arXiv:2410.07757},
year = {2024}
}
备注
Accepted by ACMMM 2024. Project page: https://wsj-sjtu.github.io/MMHead/