中文

关键点动作 Token 实现机器人上下文模仿学习

机器人学 2024-10-21 v3 机器学习 神经与进化计算

摘要

我们表明,无需任何额外训练的现成基于文本的 Transformer 即可执行少样本上下文视觉模仿学习,将视觉观测映射为模拟演示者行为的动作序列。我们通过一个称为 Keypoint Action Tokens (KAT) 的框架,将视觉观测(输入)和动作轨迹(输出)转换为文本预训练 Transformer (GPT-4 Turbo) 可以接收并生成的 Token 序列来实现这一点。尽管仅在语言上进行了训练,我们表明这些 Transformer 在将 Token 化的视觉关键点观测转换为动作轨迹方面表现出色,在一系列真实世界的日常任务中,其在低数据量情况下的表现与最先进的模仿学习(扩散策略)相当或更好。KAT 并非像通常那样在语言域中运行,而是利用基于文本的 Transformer 在视觉和动作域中运行,以学习演示数据中的一般模式,从而实现高效的模仿学习,这为将自然语言模型重新用于具身任务指明了有前景的新途径。视频可在 https://www.robot-learning.uk/keypoint-action-tokens 获取。

关键词

引用

@article{arxiv.2403.19578,
  title  = {Keypoint Action Tokens Enable In-Context Imitation Learning in Robotics},
  author = {Norman Di Palo and Edward Johns},
  journal= {arXiv preprint arXiv:2403.19578},
  year   = {2024}
}

备注

Published at Robotics: Science and Systems (RSS) 2024