中文

面向视觉语言-动作模型的仿真数据收集教程

机器人学 2025-08-12 v1

摘要

传统机器人系统通常将智能 decomposes 为独立的计算机视觉、自然语言处理和运动控制模块。视觉语言-动作 (VLA) 模型通过单一神经网络同时处理视觉观察、理解人类指令并直接输出机器人动作,从而根本性地改变了这一方法——所有这些都在一个统一的框架中实现。然而,这些系统高度依赖能够捕捉视觉观察、语言指令和机器人动作之间复杂关系的高质量训练数据集。本教程综述了三个具有代表性的系统:用于灵活定制数据生成的 PyBullet 仿真框架、用于标准化任务定义和评估的 LIBERO 基准套件,以及用于大规模多机器人数据获取的 RT-X 数据集。我们演示了在 PyBullet 仿真中进行数据生成,以及在 LIBERO 中进行定制数据收集的做法,并概述了 RT-X 数据集的特征和作用,以进行大规模多机器人数据获取。

关键词

引用

@article{arxiv.2508.06547,
  title  = {A tutorial note on collecting simulated data for vision-language-action models},
  author = {Heran Wu and Zirun Zhou and Jingfeng Zhang},
  journal= {arXiv preprint arXiv:2508.06547},
  year   = {2025}
}

备注

This is a tutorial note for educational purposes