中文

Zero-1-to-A:基于视频扩散的零样态一图到可动画头部头像

计算机视觉与模式识别 2025-03-26 v2

摘要

可动画头部头像生成通常需要大量训练数据。为减少数据需求,自然的解决方案是利用现有数据无关的静态头像生成方法,例如使用得分蒸馏抽样 (SDS) 的预训练扩散模型,将头像与扩散模型生成的伪基准输出对齐。然而,直接从视频扩散模型中蒸馏 4D 头像常导致结果过于平滑,due to 空间和时间上的不一致性。为此,我们提出 Zero-1-to-A 方法,通过视频扩散模型合成 4D 头像重建的空间和时间一致性数据集。具体而言,Zero-1-to-A 以迭代方式构建视频数据集并逐步优化可动画头像,确保头像质量在学习过程中平滑且一致。该渐进式学习包括两个阶段:(1) 空间一致性学习固定表情并从正面到侧面视图学习;(2) 时间一致性学习固定视图并从放松到夸张的表情学习,以简单到复杂的方式生成 4D 头像。大量实验表明,Zero-1-to-A 在保真度、动画质量和渲染速度方面优于现有基于扩散的方法,为创建逼真的头像提供了解决方案。代码已公开:https://github.com/ZhenglinZhou/Zero-1-to-A。

关键词

引用

@article{arxiv.2503.15851,
  title  = {Zero-1-to-A: Zero-Shot One Image to Animatable Head Avatars Using Video Diffusion},
  author = {Zhenglin Zhou and Fan Ma and Hehe Fan and Tat-Seng Chua},
  journal= {arXiv preprint arXiv:2503.15851},
  year   = {2025}
}

备注

Accepted by CVPR 2025, project page: https://zhenglinzhou.github.io/Zero-1-to-A/