中文

LaST-R1:通过自适应物理潜在推理强化机器人操作

机器人学 2026-05-08 v3 计算机视觉与模式识别

摘要

机器人基础模型需要对复杂视觉场景进行推理,以在动态环境中执行自适应动作。尽管近期关于潜在推理视觉-语言-动作(VLA)模型的研究已证明其具备捕捉细粒度物理动态的能力,但它们仍主要局限于静态模仿学习,严重限制了其适应性和泛化能力。在本文中,我们提出了 LaST-R1,这是一种新颖的强化学习(RL)后训练框架,旨在有效利用“先潜在推理后行动”的策略。具体来说,我们提出了潜在到动作策略优化(LAPO),这是一种核心 RL 算法,可联合优化潜在推理过程和动作生成。通过将潜在思维链(CoT)推理显式地直接嵌入 RL 优化循环中,LAPO 激发了深刻的物理世界建模,进而驱动在交互式环境中的鲁棒执行。此外,还引入了一种自适应潜在 CoT 机制,允许策略根据不同的环境状态动态调整其推理范围。实验表明,LaST-R1 仅需一次监督预热,就在 LIBERO 基准测试上实现了近乎完美的 99.9% 平均成功率,显著提升了收敛速度和性能,超越了先前的最先进(SOTA)方法。在真实世界部署中,LaST-R1 在包括单臂和双臂设置的四个复杂任务上,比 SOTA 监督微调方法平均提升了高达 22.5% 的性能。最后,LaST-R1 在模拟和真实世界环境中均展现出强大的泛化能力。

关键词

引用

@article{arxiv.2604.28192,
  title  = {LaST-R1: Reinforcing Robotic Manipulation via Adaptive Physical Latent Reasoning},
  author = {Hao Chen and Jiaming Liu and Zhonghao Yan and Nuowei Han and Renrui Zhang and Chenyang Gu and Jialin Gao and Ziyu Guo and Siyuan Qian and Yinxi Wang and Peng Jia and Shanghang Zhang and Pheng-Ann Heng},
  journal= {arXiv preprint arXiv:2604.28192},
  year   = {2026}
}