中文

Robo2VLM:来自大规模野外机器人操作数据集的视觉问答

机器人学 2025-06-23 v2 人工智能 计算与语言 机器学习

摘要

视觉语言模型(VLM)通过互联网规模的图像-文本语料库获取现实世界知识和通用推理能力。它们可以增强机器人系统的场景理解和任务规划能力,并辅助基于机器人轨迹数据训练的视觉运动策略。我们探索反向范式——利用丰富的、真实的、多模态机器人轨迹数据来增强和评估VLM。在本文中,我们提出了Robo2VLM,一种面向VLM的视觉问答(VQA)数据集生成框架。给定一个人力遥操作机器人轨迹,Robo2VLM从非视觉和非描述性感官模态(如末端执行器位姿、夹爪开口和力传感)推导真实标签。基于这些模态,它将机器人轨迹分割为操作阶段的序列。在每个阶段,Robo2VLM利用场景和交互理解来识别机器人的三维属性、任务目标和目标对象的属性。这些属性被用于生成代表性的VQA查询——基于空间、条件目标和交互推理问题模板的带有文本的多选题图像。我们整理了Robo2VLM-1,一个大规模的野外数据集,包含684,710个问题,覆盖463个不同场景和3,396个机器人操作任务,来自176k条真实机器人轨迹。结果表明Robo2VLM-1可以基准测试并提升VLM在空间和交互推理方面的能力。

关键词

引用

@article{arxiv.2505.15517,
  title  = {Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets},
  author = {Kaiyuan Chen and Shuangyu Xie and Zehan Ma and Pannag R Sanketi and Ken Goldberg},
  journal= {arXiv preprint arXiv:2505.15517},
  year   = {2025}
}