中文

RoboInter:面向机器人操作的综合中间表示套件

机器人学 2026-02-11 v1

摘要

大型视觉语言模型(VLM)的进步刺激了对视觉语言-动作(VLA)系统进行机器人操作的日益关注。然而,现有操作数据集成本高昂、针对性强且覆盖和多样性不足,从而阻碍了 VLA 模型的泛化。最近的做法尝试通过计划-执行范式来缓解这些限制,即先生成高层计划(如子任务、轨迹),然后翻译为低层动作,但它们关键依赖额外的中间监督,而现有数据集中缺乏这种中间监督。为填补这一差距,我们引入 RoboInter 操作套件,一个包括数据、基准和中间表示模型的统一资源。它包含 RoboInter-Tool,一个轻量级 GUI,用于半自动标注多样化的表示;以及 RoboInter-Data,一个包含 23 万多个剧集、覆盖 571 个多样化场景的大规模数据集,提供超过 10 类中间表示的稠密逐帧标注,显著超过以往工作在规模和标注质量方面的表现。基于此基础,RoboInter-VQA 引入 9 类空间和 20 类时间具身 VQA 类别,以系统性地评估和提升 VLMs 的具身推理能力。与此同时,RoboInter-VLA 提供一个集成的计划-执行框架,支持模块化和端到端的 VLA 变体,通过中间监督将高层规划与低层执行相连。总体而言,RoboInter 为通过细粒度和多样化的中间表示,为推进稳健且可泛化的机器人学习奠定了实用基础。

关键词

引用

@article{arxiv.2602.09973,
  title  = {RoboInter: A Holistic Intermediate Representation Suite Towards Robotic Manipulation},
  author = {Hao Li and Ziqin Wang and Zi-han Ding and Shuai Yang and Yilun Chen and Yang Tian and Xiaolin Hu and Tai Wang and Dahua Lin and Feng Zhao and Si Liu and Jiangmiao Pang},
  journal= {arXiv preprint arXiv:2602.09973},
  year   = {2026}
}

备注

Published to ICLR 2026, 69 pages, 40 figures