基于对象中心表示的目标条件模型预测控制
机器学习
2026-05-15 v1 人工智能
机器人学
摘要
预测世界模型使代理能够建模场景动力学并推理其动作后果。受人类感知启发,对象中心世界模型使用对象级别表示捕获场景动力学,可用于下游应用,如动作规划。然而,大多数对象中心世界模型和强化学习(RL)方法学习的是在推断时固定的反应式策略,这限制了对新情境的泛化。我们提出Slot-MPC,一种对象中心世界建模框架,支持通过模型预测控制(MPC)进行规划。Slot-MPC利用视觉编码器学习基于槽位的表示,这些表示编码场景中的 individual objects,并利用这些结构化表示来学习一个动作条件的对象中心动力学模型。在推断时,所学动力学模型启用通过MPC进行动作规划,使代理能够适应 previously 未遇到的情境。由于所学世界模型是可微的,我们可以使用基于梯度的MPC直接优化动作,这比依赖梯度-free、基于抽样的MPC方法更具计算效率。在模拟机器人操纵任务上的实验显示,Slot-MPC 在非对象中心世界模型基线之上在任务性能和规划效率方面都有所提高。在所考察的离线设置且状态-动作覆盖有限的情况下,我们发现基于梯度的MPC在基于梯度-free、抽样-based的MPC方面表现更好。我们的结果表明,显式结构化、对象中心表示为可控和可泛化的决策提供了强大的归纳偏置。代码和附加结果可在 https://slot-mpc.github.io 获取。
引用
@article{arxiv.2605.14937,
title = {Slot-MPC: Goal-Conditioned Model Predictive Control with Object-Centric Representations},
author = {Jonathan Spieler and Angel Villar-Corrales and Sven Behnke},
journal= {arXiv preprint arXiv:2605.14937},
year = {2026}
}