迈向场景图预测
计算机视觉与模式识别
2024-07-22 v2 人工智能
摘要
时空场景图通过将场景分解为单个物体及其成对时间关系来表示视频中的交互。对物体之间细粒度成对关系的长期预测是一个具有挑战性的问题。为此,我们引入了场景图预测(SGA)任务。我们将最先进的场景图生成方法作为基线进行适配,以预测物体之间未来的成对关系,并提出了一种新方法 SceneSayer。在 SceneSayer 中,我们利用以物体为中心的关系表示来对观测到的视频帧进行推理,并对物体之间关系的演化进行建模。我们采用连续时间视角,分别利用 NeuralODE 和 NeuralSDE 的概念对物体交互演化的潜在动力学进行建模。我们分别通过求解常微分方程和随机微分方程来推断未来关系的表示。在 Action Genome 数据集上的大量实验验证了所提方法的有效性。
引用
@article{arxiv.2403.04899,
title = {Towards Scene Graph Anticipation},
author = {Rohith Peddi and Saksham Singh and Saurabh and Parag Singla and Vibhav Gogate},
journal= {arXiv preprint arXiv:2403.04899},
year = {2024}
}
备注
ECCV 2024, Code: https://github.com/rohithpeddi/SceneSayer