中文

NovaPlan:基于闭环视频语言规划的零样本长期操控

机器人学 2026-02-24 v1 人工智能 计算机视觉与模式识别

摘要

解决长期操控任务需要机器人将高层语义推理与低层物理交互集成。虽然视觉语言模型(VLMs)和视频生成模型可以分解任务并想象结果,但它们往往缺乏针对实际执行所需的物理 grounding。我们引入 NovaPlan,一个层次化框架,将闭环 VLM 和视频规划与几何 grounded 机器人执行统一,用于零样本长期操控。在高层,VLM 规划器分解任务为子目标并监控机器人执行,使系统能够通过自主重新规划从单步失败中恢复。为了计算低层机器人动作,我们从生成的视频中提取并利用任务相关对象关键点和人类手部姿态作为运动学先验,并采用切换机制在两者之间选择更佳者作为机器人动作的参考,维持即使在严重遮挡或深度不准时也能稳定执行。我们在三个长期操控任务和 Functional Manipulation Benchmark(FMB)上展示了 NovaPlan 的有效性。我们的结果表明,NovaPlan 能够完成复杂的装配任务并表现出灵巧的错误恢复行为,无需任何先验演示或训练。项目页面: https://nova-plan.github.io/

关键词

引用

@article{arxiv.2602.20119,
  title  = {NovaPlan: Zero-Shot Long-Horizon Manipulation via Closed-Loop Video Language Planning},
  author = {Jiahui Fu and Junyu Nan and Lingfeng Sun and Hongyu Li and Jianing Qian and Jennifer L. Barry and Kris Kitani and George Konidaris},
  journal= {arXiv preprint arXiv:2602.20119},
  year   = {2026}
}

备注

25 pages, 15 figures. Project webpage: https://nova-plan.github.io/