无姿态、无问题的 4D:从未标记的多视角视频获取前馈动态高斯
计算机视觉与模式识别
2026-05-22 v1
摘要
最近的 feed-forward 3D 高斯溶解方法在 3D 场景重建的各个方面取得了显著进展,但尚无方法在单一的 feed-forward pass 中同时处理动态内容、多视角输入和未知相机姿态。处理动态的要么需要准确的相机姿态,要么只接受单目输入;姿态自由的多视角方法仅处理静态场景;而以场景为单位的优化方法则在每个场景上耗时从分钟到小时。我们引入 NoPo4D,是首个解决这一空白四象限的 feed-forward 系统。基于预训练的几何 backbone 和最近的 4D 高斯框架,NoPo4D 引入了速度分解,将高斯运动分为像素图像平面位移和深度变化,允许直接来自伪 ground-truth 光流的 2D 成分监督。这绕过了将先前姿态方法与姿态精度耦合的可微渲染,以及先前姿态自由方法所需的 3D 运动 ground truth。系统还包括双向运动 encoder 用于跨视角和跨帧特征聚合,以及视角依赖不透明度以缓解跨视角和跨时间步高斯错位。 在四个多视角动态基准数据集上,NoPo4D 持续优于先前的 feed-forward baseline,并通过可选的后优化阶段超越以场景为单位的优化方法,同时运行速度快了数量级。
引用
@article{arxiv.2605.22190,
title = {No Pose, No Problem in 4D: Feed-Forward Dynamic Gaussians from Unposed Multi-View Videos},
author = {Matteo Balice and Yanik Kunzi and Chenyangguang Zhang and Matteo Matteucci and Marc Pollefeys and Sungwhan Hong},
journal= {arXiv preprint arXiv:2605.22190},
year = {2026}
}
备注
https://bralani.github.io/nopo4d_html/