StageCraft:面向 VLA 模型消除干扰与阻塞故障的执行感知方法
机器人学
2026-03-24 v1
摘要
大规模在文本和图像数据上进行预训练,以及多样化的机器人演示,有助于 Vision Language Action 模型 (VLA) 泛化到新任务、新物体和新场景。然而,这些模型在面临执行时的阻抗情况时仍然容易失败,例如机器人工作空间中的干扰物和物理阻塞。现有的策略改进方法通过微调基础 VLA 以提高泛化性,但仍在未见的干扰设置中捉襟见肘。为此,我们调查是否可以利用 internet 规模的预训练大型视觉语言模型 (VLM) 来推理这些阻抗情况并缓解策略故障。为此,我们提出 StageCraft,一种改进预训练 VLA 策略性能的 training-free 方法,通过操纵环境初始状态来实现,利用 VLM 基于情境的推理。StageCraft 以策略 rollout 视频和成功标签为输入,利用 VLM 的推理能力推断初始状态中哪些物体需要被操纵以避免预期的执行故障。StageCraft 是一个可扩展的即插即用模块,不会在底层策略上引入额外约束,仅需少量策略 rollout 即可工作。我们评估了最先进的 VLA 模型配合 StageCraft 的性能,在三个真实世界任务域中表现提升了绝对 40%,该域涉及多样化的干扰物和阻塞。我们的仿真实验在 RLBench 中表明,StageCraft 根据底层策略的强度调整其干预程度,并通过提供更多情境样本来提高其性能。StageCraft 实际效果的视频可在 https://stagecraft-decorator.github.io/stagecraft/ 查看。
引用
@article{arxiv.2603.20659,
title = {StageCraft: Execution Aware Mitigation of Distractor and Obstruction Failures in VLA Models},
author = {Kartikay Milind Pangaonkar and Prabin Rath and Omkar Patil and Nakul Gopalan},
journal= {arXiv preprint arXiv:2603.20659},
year = {2026}
}