中文

零样本插销插入:利用视觉-语言模型识别配合孔并估计 SE(2) 位姿

机器人学 2025-03-11 v1 人工智能 计算机视觉与模式识别

摘要

实现零样本插销插入,即在无需任务特定训练的情况下将任意插销插入未见过的孔中,仍然是机器人技术中的一项基本挑战。该任务要求一个具有高度泛化能力的感知系统,能够检测潜在的孔,从多个候选孔中选择正确的配合孔,估计其精确位姿,并在存在不确定性的情况下执行插入。尽管基于学习的方法已应用于插销插入,但它们通常无法泛化到训练过程中遇到的具体插销-孔对之外。视觉-语言模型(VLMs)的最新进展提供了一种有前景的替代方案,通过利用大规模数据集实现对各种任务的鲁棒泛化。受其成功启发,我们引入了一种新颖的零样本插销插入框架,该框架利用 VLM 在没有其几何先验知识的情况下识别配合孔并估计其位姿。大量实验表明,我们的方法达到了 90.2% 的准确率,在识别各种以前未见过的插销-孔对(包括 3D 打印对象、玩具拼图和工业连接器)中的正确配合孔方面显著优于基线方法。此外,我们在 PC 背板的实际连接器插入任务中验证了我们方法的有效性,我们的系统成功检测孔,识别正确的配合孔,估计其位姿,并以 88.3% 的成功率完成插入。这些结果突显了 VLM 驱动的零样本推理在实现鲁棒且可泛化的机器人装配方面的潜力。

关键词

引用

@article{arxiv.2503.06026,
  title  = {Zero-Shot Peg Insertion: Identifying Mating Holes and Estimating SE(2) Poses with Vision-Language Models},
  author = {Masaru Yajima and Kei Ota and Asako Kanezaki and Rei Kawakami},
  journal= {arXiv preprint arXiv:2503.06026},
  year   = {2025}
}

备注

Under submission