中文

NovaFlow:通过生成视频中的可执行流实现零样本操控

机器人学 2025-10-10 v1 人工智能 计算机视觉与模式识别

摘要

实现机器人对新操控任务的零样本执行是机器人学的核心目标。大多数现有方法假设任务在分布内,或依赖具embodiment匹配数据的微调,限制了跨平台的迁移能力。我们提出 NovaFlow,一种无需任何演示的自主操控框架,将任务描述转换为目标机器人的可执行计划。给定任务描述,NovaFlow 使用视频生成模型合成视频,并通过可插拔感知模块将其提炼为 3D 可执行对象流。从对象流中,它计算刚性对象的相对姿态,并通过抓取提议和轨迹优化将其实现为机器人动作。对于可变形对象,该流作为基于粒子动力学模型的模型化规划的跟踪目标。通过将任务理解与低层控制解耦,NovaFlow 能自然跨embodiment进行迁移。我们在使用桌面 Franka 机械臂和 Spot 四足移动机器人上验证了刚性、关节和可变形物体操控任务,实现了无演示、无embodiment特定训练的有效零样本执行。项目网址:https://novaflow.lhy.xyz/。

关键词

引用

@article{arxiv.2510.08568,
  title  = {NovaFlow: Zero-Shot Manipulation via Actionable Flow from Generated Videos},
  author = {Hongyu Li and Lingfeng Sun and Yafei Hu and Duy Ta and Jennifer Barry and George Konidaris and Jiahui Fu},
  journal= {arXiv preprint arXiv:2510.08568},
  year   = {2025}
}