ManipLVM-R1:基于大型视觉语言模型的机械臂操作推理强化学习
机器人学
2025-05-27 v2 计算机视觉与模式识别
摘要
大型视觉语言模型(LVLMs)最近通过利用视觉进行场景感知和语言进行指令跟随,推动了机器人操作的发展。然而,现有方法高度依赖昂贵的人工标注训练数据集,这限制了其泛化能力,使其在超出域(OOD)场景中难以胜任,降低了现实适应性。为应对这些挑战,我们提出ManipLVM-R1,一种新型强化学习框架,用可验证奖励(RLVR)取代传统监督。通过直接优化与任务对齐的收益,我们的方法增强了泛化性和物理推理能力,同时消除了对昂贵标注的依赖。具体而言,我们设计了两个基于规则的奖励函数,针对关键的机器人操作子任务:一种是交互感知奖励,用于增强交互区域的定位;另一种是轨迹匹配奖励,用于确保动作路径的物理合理性。这些奖励提供即时反馈并施加空间逻辑约束,鼓励模型超越浅层模式匹配,学习更深入、更系统化的物理交互推理。
引用
@article{arxiv.2505.16517,
title = {ManipLVM-R1: Reinforcement Learning for Reasoning in Embodied Manipulation with Large Vision-Language Models},
author = {Zirui Song and Guangxian Ouyang and Mingzhe Li and Yuheng Ji and Chenxi Wang and Zixiang Xu and Zeyu Zhang and Xiaoqing Zhang and Qian Jiang and Zhenhao Chen and Zhongzhi Li and Rui Yan and Xiuying Chen},
journal= {arXiv preprint arXiv:2505.16517},
year = {2025}
}
备注
14pages