ORACLE-Grasp:基于大型多模态模型的零样态、可 afford 匹配的机器人抓取
机器人学
2026-02-17 v2
摘要
在非结构化环境中抓取未知物体是服务机器人面临的关键挑战,这些机器人必须在家庭、医院和仓库等动态真实环境中运行。成功的关键在于具备语义理解和空间推理能力。传统方法常依赖密集训练数据集或详细几何模型,要求大量数据收集且对新物体或新 affordances 泛化性差。我们提出了 ORACLE-Grasp,一个零样态框架,利用大型多模态模型(LMM)作为语义 oracle 来指导可 afford 匹配的抓取选择,无需任务特定训练或手动输入。该系统将抓取预测重新构建为结构化、迭代的决策过程,采用双提示工具调用策略:第一个提示提取高层次对象语义,第二个提示识别与对象功能匹配的可抓取区域。为解决 LMM 的空间局限性,ORACLE-Grasp 将图像离散化为候选区域并对其进行推理,以产生类人且情境敏感的抓取建议。深度数据可用于细化抓取可靠性,同时采用早停机制提高计算效率。我们在多样化的 RGB 和 RGB-D 图像上进行了评估,包含日常物品和 AI 生成物品。结果表明,该方法产生的抓取在物理可行性和语义恰当性方面均符合人类标注,实现了高成功率的真实世界抓取任务。我们的发现凸显了 LMM 在实现自主服务机器人灵活且可泛化抓取策略方面的潜力,无需对象特定模型或大量训练。
引用
@article{arxiv.2505.08417,
title = {ORACLE-Grasp: Zero-Shot Affordance-Aligned Robotic Grasping using Large Multimodal Models},
author = {Avihai Giuili and Rotem Atari and Avishai Sintov},
journal= {arXiv preprint arXiv:2505.08417},
year = {2026}
}