MonoFusion:稀疏视角单目融合 4D 重建
计算机视觉与模式识别
2026-03-03 v2
摘要
我们解决动态场景从稀疏视角视频的重建问题。先前的工作通常需要密集的多视角捕获,包括数百个标定好的摄像机(例如 Panoptic Studio)。此类多视角 setup 构建成本高昂,无法在野外捕获多样化场景。相反,我们旨在从少量稀疏视角摄像机(例如四个等距 inward-facing 静止摄像机)中重建动态人类行为,如修理自行车或跳舞。我们发现,密集多视角重建方法因视角间重叠度有限而难以适应稀疏视角 setup。为此,我们仔细对每个摄像机的独立单目重建进行对齐,以产生时-视角一致的动态场景重建。在 PanopticStudio 和 Ego-Exo4D 上进行大量实验表明,我们的方法在重建质量上优于先前工作,尤其在渲染新视角时效果更佳。代码、数据和数据处理脚本均已在 https://github.com/Z1hanW/MonoFusion 提供。
引用
@article{arxiv.2507.23782,
title = {MonoFusion: Sparse-View 4D Reconstruction via Monocular Fusion},
author = {Zihan Wang and Jeff Tan and Tarasha Khurana and Neehar Peri and Deva Ramanan},
journal= {arXiv preprint arXiv:2507.23782},
year = {2026}
}
备注
ICCV 2025. Project Page: https://z1hanw.github.io/research/25_DSR/