中文

通过稠密对应从无动作视频中学习执行动作

机器人学 2023-10-13 v1 计算机视觉与模式识别 机器学习 机器学习

摘要

在本工作中,我们提出了一种基于视频的机器人策略构建方法,能够在无需任何动作标注的情况下,通过少量视频演示可靠地跨不同机器人和环境执行多样化任务。我们的方法利用图像作为任务无关表征,编码状态与动作信息,并利用文本作为指定机器人目标的通用表征。通过合成“幻觉”出机器人执行动作的视频,并结合帧间的稠密对应,我们的方法能够推断出在环境中执行的闭式动作,而无需任何显式动作标签。这一独特能力使我们能够仅基于 RGB 视频训练策略,并将学习到的策略部署到各种机器人任务中。我们展示了我们的方法在桌面操作和导航任务中学习策略的有效性。此外,我们贡献了一个开源的高效视频建模框架,能够在单日内使用四块 GPU 训练高保真策略模型。

关键词

引用

@article{arxiv.2310.08576,
  title  = {Learning to Act from Actionless Videos through Dense Correspondences},
  author = {Po-Chen Ko and Jiayuan Mao and Yilun Du and Shao-Hua Sun and Joshua B. Tenenbaum},
  journal= {arXiv preprint arXiv:2310.08576},
  year   = {2023}
}

备注

Project page: https://flow-diffusion.github.io/