中文

FDSG:动态场景图预测

计算机视觉与模式识别 2025-07-21 v2

摘要

动态场景图生成通过建模实体关系及其时间演化,将场景图生成从图像扩展到视频。然而,现有方法要么从观测帧生成场景图而不显式建模时间动态,要么仅预测关系而假设实体标签和位置是静态的。这些局限性阻碍了对实体和关系动态的有效外推,限制了视频场景理解。我们提出了预测动态场景图(Forecasting Dynamic Scene Graphs, FDSG),这是一种新颖的框架,用于为未观测帧预测未来实体标签、边界框和关系,同时也为观测帧生成场景图。我们的场景图预测模块利用查询分解和神经随机微分方程来建模实体和关系动态。时间聚合模块通过交叉注意力整合预测和观测信息,进一步优化预测。为了对 FDSG 进行基准测试,我们引入了场景图预测(Scene Graph Forecasting),这是一项用于完整未来场景图预测的新任务。在 Action Genome 上的实验表明,FDSG 在动态场景图生成、场景图预测和场景图预测任务上均优于现有最先进的方法。代码将在发表后发布。

关键词

引用

@article{arxiv.2506.01487,
  title  = {FDSG: Forecasting Dynamic Scene Graphs},
  author = {Yi Yang and Yuren Cong and Hao Cheng and Bodo Rosenhahn and Michael Ying Yang},
  journal= {arXiv preprint arXiv:2506.01487},
  year   = {2025}
}

备注

16 pages, 8 figures, 12 tables