中文

OmniJARVIS: Unified Vision-Language-Action Tokenization Enables Open-World Instruction Following Agents

机器学习 2024-11-01 v2 人工智能 计算与语言

摘要

本文提出 OmniJARVIS,一种用于开放世界指令跟随代理的新型视觉-语言-动作(VLA)模型。与先前方法要么发出文本目标供独立控制器,要么直接产生控制命令不同,OmniJARVIS 寻求另一条路径确保强大的推理与高效决策能力,方法是对多模态交互数据进行统一标记化。首先,我们引入一种自监督方法,以产生行为编码器,用于生成行为轨迹 τ={o0,a0,}\tau = \{o_0, a_0, \dots\} 的离散标记,并基于这些标记的imitation learning 策略解码器进行条件化。这些额外的行为标记将被增强到预训练多模态语言模型的词汇表中。有了这个编码器,我们将涉及任务指令、记忆、思考、观察、文本响应、行为轨迹等的长期多模态交互打包为统一的标记序列并用自回归变换器建模。由于具有语义意义的行为标记,最终得到的 VLA 模型 OmniJARVIS 可以进行推理(通过生成链式思维),进行计划,回答问题,以及产生行为标记供 imitation learning 策略解码器执行。OmniJARVIS 在 Minecraft 中一系列原子任务、程序化任务和开放性任务上的表现优异。我们的分析进一步揭示了交互数据构建、统一标记化以及其规模潜力的关键设计原则。该数据集、模型和代码将在 https://craftjarvis.org/OmniJARVIS 上发布。

关键词

引用

@article{arxiv.2407.00114,
  title  = {OmniJARVIS: Unified Vision-Language-Action Tokenization Enables Open-World Instruction Following Agents},
  author = {Zihao Wang and Shaofei Cai and Zhancun Mu and Haowei Lin and Ceyao Zhang and Xuejie Liu and Qing Li and Anji Liu and Xiaojian Ma and Yitao Liang},
  journal= {arXiv preprint arXiv:2407.00114},
  year   = {2024}
}

备注

accepted on NeurIPS 2024