中文

UniAvatar:通过综合运动和光照控制驯服基于音频的逼真说话头部生成

计算机视觉与模式识别 2024-12-31 v1

摘要

最近,利用音频输入为人物图像生成动画是热门任务。创建逼真的说话头部视频需要灵活自然的运动,包括面部和头部动力学、相机运动、逼真的光照和阴影效果。现有方法难以提供对这些方面的全面、多层次的控制。在本工作中,我们引入了 UniAvatar,一种提供广泛运动和照明条件控制的设计方法。具体而言,我们使用 FLAME 模型将所有运动信息渲染到单张图像上,既保持 3D 运动细节的完整性,又实现细粒度的像素级控制。除了运动,该方法还允许进行全面的全局光照控制。我们设计了独立的模块来管理 3D 运动和光照,允许独立或组合控制。大量实验表明,我们的方法在广泛的运动控制和光照控制方面均优于其他方法。此外,为增强当前数据集中运动和环境情境的多样性,我们收集并计划公开发布两个数据集,DH-FaceDrasMvVid-100 和 DH-FaceReliVid-200,后者捕获了大幅度头部运动和各种光照场景。

关键词

引用

@article{arxiv.2412.19860,
  title  = {UniAvatar: Taming Lifelike Audio-Driven Talking Head Generation with Comprehensive Motion and Lighting Control},
  author = {Wenzhang Sun and Xiang Li and Donglin Di and Zhuding Liang and Qiyuan Zhang and Hao Li and Wei Chen and Jianxun Cui},
  journal= {arXiv preprint arXiv:2412.19860},
  year   = {2024}
}