中文

Make-Your-Anchor:基于扩散的 2D 虚拟主播生成框架

计算机视觉与模式识别 2024-03-26 v1

摘要

尽管基于说话人头的虚拟主播创建方案取得了显著进展,但直接生成具有全身动作的主播风格视频仍然具有挑战性。在本研究中,我们提出了 Make-Your-Anchor,一个仅需个人一分钟视频片段进行训练,随后便能自动生成具有精确躯干和手部动作的主播风格视频的新型系统。具体而言,我们在输入视频上微调一个提出的结构引导扩散模型,将 3D 网格条件渲染为人体外观。我们为扩散模型采用两阶段训练策略,有效地将动作与特定外观绑定。为生成任意长的时序视频,我们将逐帧扩散模型中的 2D U-Net 扩展为 3D 风格,无需额外训练成本,并提出一个简单而有效的批次重叠时序去噪模块,以绕过推理期间对视频长度的限制。最后,引入一个新颖的身份特定面部增强模块,以提升输出视频中面部区域的视觉质量。对比实验证明了该系统在视觉质量、时序连贯性和身份保持方面的有效性和优越性,优于 SOTA 扩散/非扩散方法。项目页面:\url{https://github.com/ICTMCG/Make-Your-Anchor}。

关键词

引用

@article{arxiv.2403.16510,
  title  = {Make-Your-Anchor: A Diffusion-based 2D Avatar Generation Framework},
  author = {Ziyao Huang and Fan Tang and Yong Zhang and Xiaodong Cun and Juan Cao and Jintao Li and Tong-Yee Lee},
  journal= {arXiv preprint arXiv:2403.16510},
  year   = {2024}
}

备注

accepted at CVPR2024