PlaTe:程序化任务中基于 Transformer 的视觉基础规划
机器人学
2022-03-11 v2
摘要
在本工作中,我们研究了如何利用教学视频来促进对人类决策过程的理解,重点在于训练一个能够从真实世界视频中规划目标导向程序的模型。直接从非结构化视频中学习结构化且可规划的状态与动作空间是我们任务的关键技术挑战。这存在两个问题:首先,对于非结构化视频,训练集与验证集之间的外观差异可能很大;其次,这些差异会导致决策错误在步骤中不断累积。我们通过 Planning Transformer (PlaTe) 来解决这些局限性,其优势在于能够规避基于模型的长期 rollout 中单步模型出现的累积预测误差。我们的方法同时从人类演示中学习所分配任务的潜在状态和动作信息以及决策过程的表示。在真实世界教学视频和交互式环境上进行的实验表明,与以往算法相比,我们的方法在达成指定目标方面能取得更好的性能。我们还在 UR-5 平台上验证了程序化任务应用的可行性。我们公开了代码并支持学术研究目的。
引用
@article{arxiv.2109.04869,
title = {PlaTe: Visually-Grounded Planning with Transformers in Procedural Tasks},
author = {Jiankai Sun and De-An Huang and Bo Lu and Yun-Hui Liu and Bolei Zhou and Animesh Garg},
journal= {arXiv preprint arXiv:2109.04869},
year = {2022}
}