展示与抓取:基于零样本基础模型的少样本语义分割用于机器人抓取
机器人学
2024-04-22 v1 人工智能
摘要
机器人抓取物体的能力(即机器人抓取)对于装配或分拣等应用至关重要。在此类任务中,选择正确的抓取目标与推断正确的夹爪配置同等重要。解决该问题的常见方案依赖于语义分割模型,这类模型通常对未见物体的泛化能力较差,且需要大量时间和海量数据进行训练。为减少对大规模数据集的依赖,部分抓取流程采用少样本语义分割模型,它们能够在给定少量样本的情况下识别新类别。然而,这通常以牺牲性能为代价,且需进行微调才能在机器人抓取场景中发挥效用。在本工作中,我们提出将基础模型出色的泛化能力与高性能少样本分类器相结合,以克服上述所有局限性;该分类器作为评分函数,用于选择最接近支持集的分割结果。所提模型设计为可嵌入抓取合成流程。使用一个或五个样本的大量实验表明,我们的新方法克服了现有的性能局限,在 Graspnet-1B(+10.5% mIoU)和 Ocid-grasp(+1.6% AP)数据集上的少样本语义分割,以及真实世界少样本抓取合成(+21.7% 抓取准确率)方面均提升了现有技术水平。项目页面见:https://leobarcellona.github.io/showandgrasp.github.io/
引用
@article{arxiv.2404.12717,
title = {Show and Grasp: Few-shot Semantic Segmentation for Robot Grasping through Zero-shot Foundation Models},
author = {Leonardo Barcellona and Alberto Bacchin and Matteo Terreran and Emanuele Menegatti and Stefano Ghidoni},
journal= {arXiv preprint arXiv:2404.12717},
year = {2024}
}