从单目视频生成时空世界场景图
计算机视觉与模式识别
2026-03-16 v1
摘要
时空场景图为建模动态对象相互作用提供了原则性表示,但现有方法仍根本上是以帧为中心的:它们仅推理当前可见的对象,丢弃因遮挡而消失的实体,并在二维平面上工作。为此,我们首先引入 ActionGenome4D 数据集,将 Action Genome 视频升级为 4D 场景,通过前馈 3D 重建,为场景中每个参与动作的对象提供以世界坐标系为orientation的边界框,并包含密集的关系注释,包括因遮挡或相机运动而暂时不可见的对象的关系。基于此数据,我们正式定义了世界场景图生成 (WSGG),即在每个时间戳上构建包含场景中所有相互作用对象的世界场景图,无论这些对象是否被观察到。我们随后提出了三种互补方法,分别探索了关于未观察对象的推理的不同归纳偏置:PWG (持久世界图),通过零阶特征缓冲区实现对象持久性;MWAE (掩码世界自编码器),将未观察对象的推理重新表述为带有跨视图关联检索的掩码完成;4DST (4D 场景变换器),用由 3D 运动和相机姿态特征丰富的 per-object 时序注意力取代静态缓冲区。我们进一步设计并评估了强大的开源视觉语言模型在 WSGG 任务上的表现,通过一套基于图的 RAG 方法建立基准,为非局部关系预测提供基准。WSGG 因此将视频场景理解推进到以世界为中心、时序持久且可解释的场景推理。
引用
@article{arxiv.2603.13185,
title = {Towards Spatio-Temporal World Scene Graph Generation from Monocular Videos},
author = {Rohith Peddi and Saurabh and Shravan Shanmugam and Likhitha Pallapothula and Yu Xiang and Parag Singla and Vibhav Gogate},
journal= {arXiv preprint arXiv:2603.13185},
year = {2026}
}
备注
https://github.com/rohithpeddi/WorldSGG