中文

高保真视频到 4D 合成的高斯变差场扩散

计算机视觉与模式识别 2025-08-01 v1

摘要

本文提出一种新颖的框架用于视频到 4D 生成,从单个视频输入创建高质量的动态 3D 内容。直接的 4D 扩散建模因数据构建成本高昂且在同时表示 3D 形状、外观和运动的高维问题而极具挑战性。我们通过引入 Direct 4DMesh-to-GS Variation Field VAE,直接从 3D 动画数据中编码规范高斯点 (GS) 及其时间变化,而无需 per-instance 拟合,并将高维动画压缩到紧凑的潜在空间。建立在这一高效表示之上,我们训练了一个高斯变差场扩散模型,该模型在输入视频和规范 GS 上,以时间感知的扩散转换器为条件。我们在精心挑选的可动画 3D 对象数据集(Objaverse)上进行训练,展示了我们的方法在生成质量上优于现有方法。它还在野外视频输入上展现出惊人的泛化能力,尽管仅在合成数据上进行训练,为生成高质量动画 3D 内容开辟了道路。项目页面:https://gvfdiffusion.github.io/

关键词

引用

@article{arxiv.2507.23785,
  title  = {Gaussian Variation Field Diffusion for High-fidelity Video-to-4D Synthesis},
  author = {Bowen Zhang and Sicheng Xu and Chuxin Wang and Jiaolong Yang and Feng Zhao and Dong Chen and Baining Guo},
  journal= {arXiv preprint arXiv:2507.23785},
  year   = {2025}
}

备注

ICCV 2025. Project page: https://gvfdiffusion.github.io/