中文

VividTalk:基于 3D 混合先验的单样本音频驱动说话头生成

计算机视觉与模式识别 2023-12-08 v2

摘要

音频驱动的说话头生成近年来引起了广泛关注,并在唇形同步、富有表现力的面部表情、自然的头部姿态生成以及高视频质量方面取得了诸多进展。然而,由于音频与运动之间的一对多映射关系,目前尚无模型能够在所有这些指标上取得领先或持平。本文提出 VividTalk,这是一个两阶段的通用框架,支持生成具备上述所有特性的高视觉质量说话头视频。具体而言,在第一阶段,我们通过学习非刚性表情运动和刚性头部运动两种运动,将音频映射到网格。对于表情运动,同时采用 blendshape 和顶点作为中间表示,以最大化模型的表示能力。对于自然的头部运动,提出了一种具有两阶段训练机制的新型可学习头部姿态码本。在第二阶段,我们提出了双分支运动 VAE 和生成器,将网格转化为密集运动并逐帧合成高质量视频。大量实验表明,所提出的 VividTalk 能够大幅提升唇形同步和真实感,生成高视觉质量的说话头视频,并在客观和主观比较中均优于先前最先进的工作。

关键词

引用

@article{arxiv.2312.01841,
  title  = {VividTalk: One-Shot Audio-Driven Talking Head Generation Based on 3D Hybrid Prior},
  author = {Xusen Sun and Longhao Zhang and Hao Zhu and Peng Zhang and Bang Zhang and Xinya Ji and Kangneng Zhou and Daiheng Gao and Liefeng Bo and Xun Cao},
  journal= {arXiv preprint arXiv:2312.01841},
  year   = {2023}
}

备注

10 pages, 8 figures