即时策略:基于图扩散的上下文模仿学习
机器人学
2025-04-28 v2 人工智能
计算机视觉与模式识别
机器学习
摘要
继大型 Transformer 在上下文学习方面展现出的卓越能力之后,上下文模仿学习为机器人技术提供了一个极具前景的机遇。我们引入了 Instant Policy,它仅从一两次演示中即可即时学习新任务(无需进一步训练),通过两个关键组件实现 ICIL。首先,我们通过图表示引入归纳偏置,并将 ICIL 建模为带有学习扩散过程的图生成问题,从而能够对演示、观测和动作进行结构化推理。其次,我们展示了此类模型可以使用伪演示(在模拟中生成的任意轨迹)作为几乎无限的训练数据池进行训练。模拟与真实实验表明,Instant Policy 能够实现对各种日常机器人任务的快速学习。我们还展示了它如何作为跨本体以及向语言定义任务零样本迁移的基础。代码与视频可在 https://www.robot-learning.uk/instant-policy 获取。
引用
@article{arxiv.2411.12633,
title = {Instant Policy: In-Context Imitation Learning via Graph Diffusion},
author = {Vitalis Vosylius and Edward Johns},
journal= {arXiv preprint arXiv:2411.12633},
year = {2025}
}
备注
Code and videos are available on our project webpage at https://www.robot-learning.uk/instant-policy