中文

Uni4D:从单视频统一视觉基础模型进行 4D 建模

计算机视觉与模式识别 2025-03-28 v1 人工智能 机器学习

摘要

本文提出一种统一方法,用于从随意视频中理解动态场景。大型预训练视觉基础模型,如视觉语言、视频深度预测、运动跟踪和分割模型,提供了令人期待的能力。然而,为进行综合 4D 理解训练单个模型仍具有挑战性。我们引入 Uni4D,一个多阶段优化框架,利用多个预训练模型推进动态 3D 建模,包括静态/动态重建、相机姿态估计和稠密 3D 运动跟踪。我们的结果在动态 4D 建模中实现了状态最佳性能,视觉质量卓越。值得注意的是,Uni4D 无需重新训练或微调,凸显了将视觉基础模型用于 4D 理解的有效性。

关键词

引用

@article{arxiv.2503.21761,
  title  = {Uni4D: Unifying Visual Foundation Models for 4D Modeling from a Single Video},
  author = {David Yifan Yao and Albert J. Zhai and Shenlong Wang},
  journal= {arXiv preprint arXiv:2503.21761},
  year   = {2025}
}

备注

CVPR 2025. Project page (with code): https://davidyao99.github.io/uni4d