LATTE:语言轨迹 Transformer
机器人学
2022-09-20 v3 人工智能
计算与语言
计算机视觉与模式识别
机器学习
摘要
自然语言是表达人类意图最直观的方式之一。然而,将指令与命令转化为真实世界中的机器人运动生成与部署远非易事。将机器人固有的低层几何与运动动力学约束同人类高层语义指令相结合的挑战,传统上通过任务专用方案解决,在不同硬件平台间泛化能力弱,且常使用静态的目标动作与命令集。本工作转而提出一种灵活的基于语言的框架,允许用户修改通用机器人轨迹。我们的方法利用预训练语言模型(BERT 与 CLIP)从自由文本输入与场景图像中直接编码用户意图与目标物体,融合由 transformer 编码器网络生成的几何特征,最终使用 transformer 解码器输出轨迹,无需与任务或机器人信息相关的先验。我们大幅扩展了 Bucker 等人先前自己的工作,将轨迹参数化空间由仅 XY 运动扩展至 3D 与速度。此外,我们现训练模型使用场景中物体的实际图像作为上下文(而非文本描述),并在操纵之外的多样场景(如空中与足式机器人)中评估系统。我们的仿真与真实实验表明,我们的 transformer 模型能成功遵循人类意图,在多种环境中修改轨迹的形状与速度。代码库见:https://github.com/arthurfenderbucker/LaTTe-Language-Trajectory-TransformEr.git
引用
@article{arxiv.2208.02918,
title = {LATTE: LAnguage Trajectory TransformEr},
author = {Arthur Bucker and Luis Figueredo and Sami Haddadin and Ashish Kapoor and Shuang Ma and Sai Vemprala and Rogerio Bonatti},
journal= {arXiv preprint arXiv:2208.02918},
year = {2022}
}