通过稠密对应从无动作视频中学习执行动作
机器人学
2023-10-13 v1 计算机视觉与模式识别
机器学习
机器学习
摘要
在本工作中,我们提出了一种基于视频的机器人策略构建方法,能够在无需任何动作标注的情况下,通过少量视频演示可靠地跨不同机器人和环境执行多样化任务。我们的方法利用图像作为任务无关表征,编码状态与动作信息,并利用文本作为指定机器人目标的通用表征。通过合成“幻觉”出机器人执行动作的视频,并结合帧间的稠密对应,我们的方法能够推断出在环境中执行的闭式动作,而无需任何显式动作标签。这一独特能力使我们能够仅基于 RGB 视频训练策略,并将学习到的策略部署到各种机器人任务中。我们展示了我们的方法在桌面操作和导航任务中学习策略的有效性。此外,我们贡献了一个开源的高效视频建模框架,能够在单日内使用四块 GPU 训练高保真策略模型。
引用
@article{arxiv.2310.08576,
title = {Learning to Act from Actionless Videos through Dense Correspondences},
author = {Po-Chen Ko and Jiayuan Mao and Yilun Du and Shao-Hua Sun and Joshua B. Tenenbaum},
journal= {arXiv preprint arXiv:2310.08576},
year = {2023}
}
备注
Project page: https://flow-diffusion.github.io/