InternVLA-M1:面向通用机器人策略的空间引导视觉-语言-动作框架
信息论
2025-10-16 v1 组合数学
math.IT
摘要
我们介绍 InternVLA-M1,一个用于空间定位和机器人控制的统一框架,旨在推动指令跟随机器人向可扩展的、通用的智能发展。其核心思想是进行空间引导的视觉-语言-动作训练,其中空间定位是指令与机器人动作之间的关键链接。InternVLA-M1 采用两个阶段的管道:(i) 基于 230 万+ 空间推理数据的空间定位预训练,以确定“在何处行动”,通过对齐指令与视觉、无 embodiment 依赖的位置;(ii) 进行空间引导的动作后训练,以确定“如何行动”,通过可插拔的空间提示生成 embodiment 依赖的动作。这种空间引导的训练配方持续带来显著提升:InternVLA-M1 在 SimplerEnv Google Robot 上 outperform by +14.6%,在 WidowX 上 outperform by +17%,在 LIBERO Franka 上 outperform by +4.3%,同时在盒子、点和路径预测中展现出更强的空间推理能力。为进一步扩展指令跟随能力,我们构建了一个仿真引擎,以收集 24.4 万 条通用抓取-放置情景,实现了在 200 项任务和 3000+ 物体上的平均提升 6.2%。在实际的集群抓取-放置中,InternVLA-M1 提升了 7.3%,而通过合成 co-training,实现了对未见物体和新配置的 +20.6% 提升。此外,在长期推理密集型情景中,它超过了现有工作的 10%。这些结果凸显了空间引导训练作为可扩展且鲁棒的通用机器人统一原则。代码和模型已发布于 https://github.com/InternRobotics/InternVLA-M1
引用
@article{arxiv.2510.13777,
title = {From Random to Explicit via Subspace Designs With Applications to Local Properties and Matroids},
author = {Joshua Brakensiek and Yeyuan Chen and Manik Dhar and Zihan Zhang},
journal= {arXiv preprint arXiv:2510.13777},
year = {2025}
}
备注
41 pages