中文

L4GM:大型4D高斯重建模型

计算机视觉与模式识别 2024-06-18 v1 机器学习

摘要

我们提出了L4GM,这是第一个4D大型重建模型,能够从单视角视频输入生成动画对象——仅需一次前馈传递,耗时仅一秒。我们成功的关键是一个新颖的多视角视频数据集,其中包含来自Objaverse的经过策划和渲染的动画对象。该数据集描绘了44K个不同的对象,具有110K个动画,在48个视点中渲染,产生了12M个视频,总计300M帧。为了可扩展性,我们保持L4GM的简洁性,并直接构建在LGM之上,LGM是一个预训练的3D大型重建模型,能够从多视角图像输入输出3D高斯椭球体。L4GM从低帧率采样的视频帧输出每帧的3D高斯泼溅表示,然后将表示上采样到更高帧率以实现时间平滑性。我们在基础LGM中添加了时间自注意力层,以帮助其学习跨时间的一致性,并利用每时间步的多视角渲染损失来训练模型。通过训练一个插值模型来生成中间3D高斯表示,将表示上采样到更高的帧率。我们展示了仅在合成数据上训练的L4GM在野外视频上具有极好的泛化能力,能够生成高质量的动画3D资产。

关键词

引用

@article{arxiv.2406.10324,
  title  = {L4GM: Large 4D Gaussian Reconstruction Model},
  author = {Jiawei Ren and Kevin Xie and Ashkan Mirzaei and Hanxue Liang and Xiaohui Zeng and Karsten Kreis and Ziwei Liu and Antonio Torralba and Sanja Fidler and Seung Wook Kim and Huan Ling},
  journal= {arXiv preprint arXiv:2406.10324},
  year   = {2024}
}

备注

Project page: https://research.nvidia.com/labs/toronto-ai/l4gm