中文

Animate124:将单张图像动画化为 4D 动态场景

计算机视觉与模式识别 2024-02-20 v2

摘要

我们提出 Animate124(Animate-one-image-to-4D),首项通过文本运动描述将单张自然图像动画化为 3D 视频的工作,这是一个研究不足但具重要应用价值的问题。我们的 4D 生成利用先进的 4D 网格动态神经辐射场(NeRF)模型,并使用多个扩散先验分三个不同阶段进行优化。首先,利用参考图像并受 2D 与 3D 扩散先验引导优化静态模型,作为动态 NeRF 的初始化。随后,采用视频扩散模型学习特定主体的运动。然而,3D 视频中的物体随时间推移倾向于偏离参考图像。该漂移主要源于视频扩散模型中文本提示与参考图像的对齐不当。因此在最后阶段,利用个性化扩散先验来解决语义漂移。作为开创性的图像-文本到 4D 生成框架,我们的方法相较现有基线展现出显著进步,这由全面的定量与定性评估所证实。

关键词

引用

@article{arxiv.2311.14603,
  title  = {Animate124: Animating One Image to 4D Dynamic Scene},
  author = {Yuyang Zhao and Zhiwen Yan and Enze Xie and Lanqing Hong and Zhenguo Li and Gim Hee Lee},
  journal= {arXiv preprint arXiv:2311.14603},
  year   = {2024}
}

备注

Project Page: https://animate124.github.io