中文

OSN:单目视频中动态 3D 场景的无限表示

计算机视觉与模式识别 2024-07-09 v1 图形学 机器学习 机器人学

摘要

从单目 RGB 视频中恢复动态 3D 场景表示一直是一个具有挑战性的问题。现有工作将此问题形式化为寻找单一最合理解答,通过添加各种约束如深度先验和强几何约束,忽略了单个动态视频可能对应无限多个 3D 场景表示的事实。在本文中,我们旨在学习与输入视频匹配的所有合理 3D 场景配置,而不仅仅是推断特定的一个。为实现这一宏伟目标,我们引入了一个新的框架,称为 OSN。我们方法的关键在于一个简单而创新的对象尺度网络,以及一个联合优化模块来学习每个动态 3D 对象的准确尺度范围。这使我们能够对尽可能多的忠实 3D 场景配置进行采样。广泛的实验表明,我们的方法超越了所有基线方法,在多个合成和真实世界数据集上在动态新视角合成中实现了卓越的精度。最值得注意的是,我们的方法在学习细粒度 3D 场景几何方面显示出明显优势。我们的代码和数据可在 https://github.com/vLAR-group/OSN 获取。

关键词

引用

@article{arxiv.2407.05615,
  title  = {OSN: Infinite Representations of Dynamic 3D Scenes from Monocular Videos},
  author = {Ziyang Song and Jinxi Li and Bo Yang},
  journal= {arXiv preprint arXiv:2407.05615},
  year   = {2024}
}

备注

ICML 2024. Code and data are available at: https://github.com/vLAR-group/OSN