面向视觉语言-动作模型的仿真数据收集教程
机器人学
2025-08-12 v1
摘要
传统机器人系统通常将智能 decomposes 为独立的计算机视觉、自然语言处理和运动控制模块。视觉语言-动作 (VLA) 模型通过单一神经网络同时处理视觉观察、理解人类指令并直接输出机器人动作,从而根本性地改变了这一方法——所有这些都在一个统一的框架中实现。然而,这些系统高度依赖能够捕捉视觉观察、语言指令和机器人动作之间复杂关系的高质量训练数据集。本教程综述了三个具有代表性的系统:用于灵活定制数据生成的 PyBullet 仿真框架、用于标准化任务定义和评估的 LIBERO 基准套件,以及用于大规模多机器人数据获取的 RT-X 数据集。我们演示了在 PyBullet 仿真中进行数据生成,以及在 LIBERO 中进行定制数据收集的做法,并概述了 RT-X 数据集的特征和作用,以进行大规模多机器人数据获取。
引用
@article{arxiv.2508.06547,
title = {A tutorial note on collecting simulated data for vision-language-action models},
author = {Heran Wu and Zirun Zhou and Jingfeng Zhang},
journal= {arXiv preprint arXiv:2508.06547},
year = {2025}
}
备注
This is a tutorial note for educational purposes