论视频预测模型中实例分解的益处
计算机视觉与模式识别
2025-01-22 v1
摘要
视频预测是智能体(如机器人和自动驾驶车辆)的关键任务,因为它使它们能够预测并提前应对时间关键事件。最先进的视频预测方法通常联合且隐式地建模场景的动态,而不显式分解为单独的对象。这是具有挑战性且可能次优的,因为动态场景中的每个对象都有其自身的运动模式,通常在一定程度上独立于其他对象。在本文中,我们研究了在潜在变换器视频预测模型的背景下,显式地分别建模动态场景中对象的益处。我们在合成和真实世界数据集上进行了详细且精心控制的实验;我们的结果表明,与缺乏这种分解的类似容量模型相比,分解动态场景可以产生更高质量的预测。
引用
@article{arxiv.2501.10562,
title = {On the Benefits of Instance Decomposition in Video Prediction Models},
author = {Eliyas Suleyman and Paul Henderson and Nicolas Pugeault},
journal= {arXiv preprint arXiv:2501.10562},
year = {2025}
}