中文

4D-LRM:大尺度时空重建模型

计算机视觉与模式识别 2025-06-24 v1

摘要

我们能否将 4D 预训练规模化,以学习通用的时空表示,从而从若干视角在某些时间点重建出在任意视角任意时间点的物体?我们给出肯定的答案,引入 4D-LRM,即首个大规模 4D 重建模型,能够从无限制的视角和时间戳输入,并渲染任意新的视角-时间组合。不同于以往的 4D 方法(如基于优化的、基于几何的或生成式的),这些方法在效率、泛化或忠实度方面受限,4D-LRM 学习统一的时空表示,直接从多个时间点来自位置图像标记预测每个像素的 4D 高斯原始数据,实现了在原理上无限帧率的快速、高质量渲染。我们的结果表明,规模化时空预训练可实现准确且高效的 4D 重建。我们展示了 4D-LRM 能推广到新颖物体、在时间轴上插值,并处理多样化的相机 setup。它能在单张 A100 GPU 上以 less than 1.5 秒完成 24 帧序列的单次前向传递。

关键词

引用

@article{arxiv.2506.18890,
  title  = {4D-LRM: Large Space-Time Reconstruction Model From and To Any View at Any Time},
  author = {Ziqiao Ma and Xuweiyi Chen and Shoubin Yu and Sai Bi and Kai Zhang and Chen Ziwen and Sihan Xu and Jianing Yang and Zexiang Xu and Kalyan Sunkavalli and Mohit Bansal and Joyce Chai and Hao Tan},
  journal= {arXiv preprint arXiv:2506.18890},
  year   = {2025}
}

备注

Project page: https://4dlrm.github.io/