中文

VCoT-Grasp:基于视觉链式思考的抓取基础模型

机器人学 2025-10-08 v1 人工智能

摘要

机器人抓取是机器人操作中最基础的任务之一,抓取检测/生成长期以来是广泛研究的主题。最近,语言驱动的抓取生成 emerged as a promising direction due to its practical interaction capabilities。然而,大多数现有方法要么缺乏足够的推理和泛化能力,要么依赖复杂的模块化管道。此外,当前的抓取基础模型倾向于过度强调对话和对象语义,导致性能不佳且限制为单对象抓取。为保持在杂乱环境中的强大推理能力和泛化能力,我们提出了 VCoT-Grasp,一种采用视觉链式思考以增强抓取生成视觉理解的端到端抓取基础模型。VCoT-Grasp 采用多轮处理范式,在动态聚焦视觉输入的同时提供可解释的推理痕迹。对于训练,我们细化并引入一个大规模数据集 VCoT-GraspSet,包含 167K 个合成图像,涵盖超过 136 万个抓取,以及 400+ 个真实世界图像,包含超过 1200 个抓取,标注了中间边界框。在 VCoT-GraspSet 和真实机器人上的大量实验表明,我们的方法显著提高了抓取成功率,并能有效泛化到未见对象、背景和干扰物。更多细节请参见 https://zhanghr2001.github.io/VCoT-Grasp.github.io。

关键词

引用

@article{arxiv.2510.05827,
  title  = {VCoT-Grasp: Grasp Foundation Models with Visual Chain-of-Thought Reasoning for Language-driven Grasp Generation},
  author = {Haoran Zhang and Shuanghao Bai and Wanqi Zhou and Yuedi Zhang and Qi Zhang and Pengxiang Ding and Cheng Chi and Donglin Wang and Badong Chen},
  journal= {arXiv preprint arXiv:2510.05827},
  year   = {2025}
}