中文

VLA-Reasoner:通过在线蒙特卡洛树搜索赋予视觉-语言-动作模型推理能力

机器人学 2026-03-03 v2

摘要

视觉-语言-动作模型(VLA)通过扩展模仿学习在通用机器人操作任务中取得了优异性能。然而,现有的 VLA 仅限于预测短视的下一动作,由于增量偏差而难以应对长时程轨迹任务。为了解决这个问题,我们提出了一个名为 \method 的即插即用框架,该框架通过测试时扩展有效地赋予现成的 VLA 预见未来状态的能力。具体而言,\method 采样并展开可能的动作轨迹,其中涉及的动作是生成未来状态的基础,这使得 \method 能够通过世界模型预见并推理潜在结果,搜索最优动作。我们进一步利用蒙特卡洛树搜索(MCTS)来提高大动作空间中的搜索效率,其中逐步 VLA 预测作为根节点。同时,我们引入了一种基于核密度估计(KDE)的置信度采样机制,以在 MCTS 中实现无需冗余 VLA 查询的高效探索。我们通过离线价值评估策略评估 MCTS 中的中间状态,以对预测的未来进行评分,并通过长期反馈纠正偏差。我们在模拟器和真实世界中进行了广泛实验,证明我们提出的 VLA-Reasoner 相比 SOTA VLA 取得了显著提升。我们的方法突显了机器人操作中可扩展测试时计算的一条潜在路径。项目网站见:https://vla-reasoner.github.io/。

关键词

引用

@article{arxiv.2509.22643,
  title  = {VLA-Reasoner: Empowering Vision-Language-Action Models with Reasoning via Online Monte Carlo Tree Search},
  author = {Wenkai Guo and Guanxing Lu and Haoyuan Deng and Zhenyu Wu and Yansong Tang and Ziwei Wang},
  journal= {arXiv preprint arXiv:2509.22643},
  year   = {2026}
}

备注

8 pages, 6 figures, Accepted by ICRA 2026