中文

通过后悔在线模仿将流量转化为策略

机器人学 2026-02-13 v2 机器学习

摘要

最近的层次化机器人系统利用高级规划器提出任务计划,并利用低级策略生成机器人动作。此设计允许在无动作或甚至非机器人数据源(例如视频)上训练规划器,从而提供可迁移的高级指导。然而,将这些高级计划转化为可执行动作仍具有挑战性,尤其是高质量机器人数据稀缺时。为此,我们提出通过在线交互来改进低级策略。具体而言,我们的方法收集在线滚动数据,反事实标注相应的高级目标(从实现的结果中),并聚合这些后悔重新标记的经验来更新以目标为条件的模仿策略。我们的方法称为Hindsight Flow-conditioned Online Imitation(HinFlow),以二维点流作为高级规划器。在模拟和物理世界的各种操纵任务中,我们的方法在基线策略之上实现了超过2×2\times的性能提升,显著优于现有方法。此外,我们的框架实现了来自在不同机器人 embodiment 上训练的规划器的策略获取,显示其在可扩展和可迁移机器人学习方面的潜力。

关键词

引用

@article{arxiv.2512.19269,
  title  = {Translating Flow to Policy via Hindsight Online Imitation},
  author = {Yitian Zheng and Zhangchen Ye and Weijun Dong and Shengjie Wang and Yuyang Liu and Chongjie Zhang and Chuan Wen and Yang Gao},
  journal= {arXiv preprint arXiv:2512.19269},
  year   = {2026}
}