中文

ManipGPT:大视觉模型的可操作性分割足以支持关节物体操控吗?

机器人学 2025-10-10 v3 计算机视觉与模式识别

摘要

视觉可操作性已成为机器人学中的一种变革性方法,专注于在操控之前感知交互区域。传统方法依赖像素采样来识别成功的交互样本,或通过处理点云来进行可操作性映射。然而,这些方法计算密集,且难以适应多样化和动态的环境。本文引入了 ManipGPT,一个旨在使用大型预训练视觉变换器(ViT)预测关节物体最优交互区域的框架。我们创建了一个包含 9.9k 张模拟和真实图像的数据集,以弥合视觉 sim-to-real 差距并增强现实世界的适用性。通过在这个小数据集上微调视觉变换器,我们显著提升了部件级可操作性分割,将模型在上下文中的分割能力适配到机器人操控场景中。这使得通过生成部件级可操作性掩码并结合阻抗适应策略,能够有效实现模拟和真实环境中的操控,从而无需复杂的数据集或感知系统。

关键词

引用

@article{arxiv.2412.10050,
  title  = {ManipGPT: Is Affordance Segmentation by Large Vision Models Enough for Articulated Object Manipulation?},
  author = {Taewhan Kim and Hojin Bae and Zeming Li and Xiaoqi Li and Iaroslav Ponomarenko and Ruihai Wu and Hao Dong},
  journal= {arXiv preprint arXiv:2412.10050},
  year   = {2025}
}

备注

8 pages, 6 figures