从未见过4D场景却推断其组合式4D结构
计算机视觉与模式识别
2026-03-27 v2
摘要
现实世界中的场景通常由若干静态和动态目标组成。捕捉它们在野外的4维结构、组成和时空构型虽然极其有趣,但同样困难。因此,现有工作往往一次关注一个目标,同时依赖某些类别特定的参数化形状模型来处理动态目标。这可能导致不一致的场景构型,此外还局限于所建模的目标类别。我们提出了COM4D(组合式4D),一种仅使用静态多目标或动态单目标监督,一致且联合预测4D/3D目标结构与时空构型的方法。我们通过精心设计的2D视频输入上的空间注意力和时间注意力的训练来实现这一点。训练被解耦为从目标组成中学习与从视频中单目标动态中学习,从而完全避免依赖4D组合训练数据。在推理时,我们提出的注意力混合机制将这些独立学习的注意力相结合,无需任何4D组合示例。通过在空间和时间推理之间交替,COM4D直接从单目视频中重建包含多个交互目标的完整且持久的4D场景。此外,尽管纯粹是数据驱动的,COM4D在现有的4D目标重建和组合式3D重建这两个独立问题中取得了最先进的结果。
引用
@article{arxiv.2512.05272,
title = {Inferring Compositional 4D Scenes without Ever Seeing One},
author = {Ahmet Berke Gokmen and Ajad Chhatkuli and Luc Van Gool and Danda Pani Paudel},
journal= {arXiv preprint arXiv:2512.05272},
year = {2026}
}
备注
Project page: https://github.com/insait-institute/COM4D