用于抓取的稀少标注机器人实例分割
计算机视觉与模式识别
2025-02-13 v2 人工智能
机器人学
摘要
机器人操控物体的能力严重依赖于其视觉感知能力。在由杂乱场景和高对象变异性特征构成的领域中,大多数方法需要广泛标记的数据集,这些数据集需花费巨大的劳力进行手工标注,以训练具备能力的模型。部署后,针对陌生物体的泛化挑战意味着模型必须随其域的演进而演进。为此,我们提出一种新框架,将半监督学习 (SSL) 与通过交互学习 (LTI) 结合,使模型能够通过观察场景变更来学习,并在时间间隔后利用视觉一致性而无需标注交互序列。结果,我们的方法通过自监督方式利用部分标注数据,并通过从无标签静态图像生成的伪序列来整合时间上下文。我们在两个常见基准测试上验证了该方法:ARMBench mix-object-tote 和 OCID,在其中它实现了最先进的性能。在 ARMBench 上,我们达到了 的 ,几乎比现有工作提高了约 ,在极端稀少标注场景中取得了显著结果,仅使用 的标注数据即可达到 的 分数,而 ARMBench 上完全标注的对应版本为 。
引用
@article{arxiv.2407.01302,
title = {Robot Instance Segmentation with Few Annotations for Grasping},
author = {Moshe Kimhi and David Vainshtein and Chaim Baskin and Dotan Di Castro},
journal= {arXiv preprint arXiv:2407.01302},
year = {2025}
}