AnywhereVLA:语言条件下的探索与移动操作
机器人学
2025-09-26 v1 人工智能
摘要
我们针对不可见且不可预测的室内环境中的自然语言抓取与放置任务,提出AnywhereVLA,一种用于移动操作的模块化框架。用户文本提示作为入口,被解析为结构化任务图,用于条件化经典的SLAM(激光雷达和摄像头)、指标语义映射以及任务感知前沿探索策略。方法规划器随后选择以可见性和可达性为导向的抓取基座姿态。对于交互,一个紧凑的SmolVLA操作头部在平台抓取与放置轨迹上进行微调,针对TheRobotStudio的SO-101进行训练,将局部视觉上下文和子目标映射到抓取与放置提案中。整个系统在消费级硬件上完全运行在本地,Jetson Orin NX用于感知和VLA,Intel NUC用于SLAM、探索和控制,实现实时运行。我们在静态场景和正常人类动作下的多房间实验室中对AnywhereVLA进行了评估。在该设置下,系统实现了46%的整体任务成功率,同时在嵌入式计算上保持了良好的吞吐量。通过将经典堆栈与微调的VLA操作相结合,系统继承了基于几何的导航可靠性,以及语言条件化操作的灵活性和任务通用性。
引用
@article{arxiv.2509.21006,
title = {AnywhereVLA: Language-Conditioned Exploration and Mobile Manipulation},
author = {Konstantin Gubernatorov and Artem Voronov and Roman Voronov and Sergei Pasynkov and Stepan Perminov and Ziang Guo and Dzmitry Tsetserukou},
journal= {arXiv preprint arXiv:2509.21006},
year = {2025}
}