中文

通过解耦物体动力学与交互实现以物体为中心的视频预测

计算机视觉与模式识别 2023-08-01 v2

摘要

我们针对以物体为中心的视频预测任务提出了一个新颖框架,即从视频序列中提取组合结构,并基于视觉观测对物体动力学与交互进行建模,以预测未来物体状态,进而生成后续视频帧。为学习有意义的时空物体表征并准确预测物体状态,我们提出了两个新颖的以物体为中心的视频预测器(OCVP)transformer 模块,其将时间动力学与物体交互的处理解耦,从而呈现出改进的预测性能。在实验中,我们展示了采用 OCVP 预测器的以物体为中心预测框架如何在两个不同数据集上优于无物体感知的视频预测模型,同时保持一致且准确的物体表征。

关键词

引用

@article{arxiv.2302.11850,
  title  = {Object-Centric Video Prediction via Decoupling of Object Dynamics and Interactions},
  author = {Angel Villar-Corrales and Ismail Wahdan and Sven Behnke},
  journal= {arXiv preprint arXiv:2302.11850},
  year   = {2023}
}

备注

Accepted for publication at IEEE International Conference on Image Processing (ICIP) 2023