中文

从观察与互动进行规划

机器人学 2026-03-02 v1

摘要

观察学习需要智能体仅通过参考执行任务的观察来学习执行任务。本工作研究了在真实世界机器人学习中等效设定的情况,其中不假设具备手设计奖励和示范者动作。为解决这一数据受限的设定,本工作提出了一种基于规划的逆向强化学习(IRL)算法,用于仅从观察和互动进行世界建模。实验在真实世界中完全进行,表明该范式有效地可在不假设先验知识、预训练或任何额外数据的情况下,从观察任务进行图像基础操作任务的学习,在一个小时内完成。此外,本工作表明,所学得的世界模型表示能够从零开始在真实世界中进行在线迁移学习。与现有方法相比,包括IRL、RL和行为克隆(BC),后者具有更严格的假设,所提出的方法在样本效率和成功率方面显著更高,为在线世界建模和从观察互动进行规划提供了实际可行的路径。视频及更多内容请参见:https://uwrobotlearning.github.io/mpail2/。

关键词

引用

@article{arxiv.2602.24121,
  title  = {Planning from Observation and Interaction},
  author = {Tyler Han and Siyang Shen and Rohan Baijal and Harine Ravichandiran and Bat Nemekhbold and Kevin Huang and Sanghun Jung and Byron Boots},
  journal= {arXiv preprint arXiv:2602.24121},
  year   = {2026}
}