中文

面向物理推理与坐标系标注的无约束力学技能获取

机器人学 2025-05-16 v1

摘要

视觉语言模型(VLMs)表现出广泛的物理世界知识,包括对物理与空间属性、功能性以及运动的直观理解。通过微调,VLMs 还能原生生成机器人轨迹。我们展示,通过询问力矩而非轨迹,VLMs 能显式推理力的作用,从而在无需预训练的情况下实现一系列操控任务的零样本泛化。我们通过在机器人附着相机图像上叠加一致的坐标系视觉表征来实现查询增强。首先,我们展示了这一添加如何使运动控制框架具备多样性,在四项任务(开启/关闭盖子、推动杯子或椅子)中进行评估,这些任务涵盖了平移与旋转运动、不同力度与位置规模、不同摄像机视角、注释方案以及两种机器人平台,经过 220 项实验,实现 51% 的成功率。随后,我们演示了该框架使 VLMs 能持续推理互动反馈,以恢复任务失败或未完成的情况,无论是否由人类监督。最后,我们观察到,带有视觉标注和具身推理的提示方案可绕过 VLM 安全措施。我们对提示组件对有害行为诱导的贡献进行刻画,并讨论其对开发具身推理的意义。我们的代码、视频和数据可在 https://scalingforce.github.io/ 获取。

关键词

引用

@article{arxiv.2505.09731,
  title  = {Unfettered Forceful Skill Acquisition with Physical Reasoning and Coordinate Frame Labeling},
  author = {William Xie and Max Conway and Yutong Zhang and Nikolaus Correll},
  journal= {arXiv preprint arXiv:2505.09731},
  year   = {2025}
}