中文

PhysVLM:使视觉语言模型理解机器人物理可达性

机器人学 2025-03-14 v2 计算机视觉与模式识别

摘要

理解环境和机器人的物理可达性对任务执行至关重要。虽然最先进的视觉语言模型 (VLM) 在环境感知方面表现出色,但由于缺乏对机器人物理可达性的理解,它们在具身视觉推理任务中往往产生不准确或不切实际的响应。为解决这一问题,我们提出了一种跨不同机器人的物理可达性统一表示,即空间-物理可达性地图 (S-P Map),以及 PhysVLM,一种将可达性信息融入视觉推理的视觉语言模型。具体而言,S-P Map 将机器人的物理可达性抽象为一种与特定机器人配置无关的通用空间表示,使模型能够聚焦于可达性特征而非机器人特定参数。随后,PhysVLM 通过引入额外的特征编码器来处理 S-P Map,扩展了传统的 VLM 架构,使模型能够在不损害其通用视觉语言能力的情况下推理物理可达性。为训练和评估 PhysVLM,我们构建了一个大规模多机器人数据集 Phys100K 和一个具有挑战性的基准 EQA-phys,其中包含六种不同机器人在仿真和真实环境中的任务。实验结果表明,PhysVLM 超越了现有模型,在 EQA-phys 上相比 GPT-4o 实现了 14% 的提升,并在 RoboVQA-val 和 OpenEQA 基准上超越了 RoboMamba 和 SpatialVLM 等先进的具身 VLM。此外,S-P Map 与各种 VLM 具有很强的兼容性,将其集成到 GPT-4o-mini 中可获得 7.1% 的性能提升。

关键词

引用

@article{arxiv.2503.08481,
  title  = {PhysVLM: Enabling Visual Language Models to Understand Robotic Physical Reachability},
  author = {Weijie Zhou and Manli Tao and Chaoyang Zhao and Haiyun Guo and Honghui Dong and Ming Tang and Jinqiao Wang},
  journal= {arXiv preprint arXiv:2503.08481},
  year   = {2025}
}