中文

可执行分析概念作为视觉语言模型洞察与精确操作之间缺失的关键链接

机器人学 2025-10-10 v1 人工智能

摘要

使机器人在非结构化环境中执行精确且通用的操作仍是具身 AI 中的根本性挑战。尽管视觉语言模型(Vision-Language Models, VLMs)在语义推理和任务规划方面展现出惊人的能力,但其高级理解与实际操作中对精确物理执行的需求之间仍存在显著差距。为弥合这种“语义到物理”的鸿沟,我们引入了 GRACE—a 一个新型框架,通过可执行分析概念(Executable Analytic Concepts, EAC)——即编码对象可操作性、几何约束以及操作语义的数学定义蓝图——实现对基于 VLM 的推理进行 grounding。我们的 метод将自然语言指令和视觉信息整合到一个实例化的 EAC 中,从而推导出抓取姿态、力的方向,并规划机器人执行的物理可行运动轨迹。因此,GRACE 提供了一个统一且可解释的界面,将高级指令理解与低级机器人控制相连接,有效地通过语义-物理 grounding 实现精确且可泛化的操作。大量实验表明,GRACE 在模拟和真实环境中,对各种关节对象实现强大的零样本泛化,不需要任务特定的训练。

关键词

引用

@article{arxiv.2510.07975,
  title  = {Executable Analytic Concepts as the Missing Link Between VLM Insight and Precise Manipulation},
  author = {Mingyang Sun and Jiude Wei and Qichen He and Donglin Wang and Cewu Lu and Jianhua Sun},
  journal= {arXiv preprint arXiv:2510.07975},
  year   = {2025}
}