ZISVFM:利用视觉基础模型在室内机器人环境中进行零样本物体实例分割
计算机视觉与模式识别
2025-02-06 v1 机器人学
摘要
在非结构化环境中运行的服务机器人必须有效识别和分割未知物体以增强其功能。传统的基于监督学习的分割技术需要大量标注数据集,这对于现实场景中遇到的物体多样性来说是不切实际的。未见物体实例分割(UOIS)方法旨在通过在合成数据上训练模型以泛化到新物体来解决这个问题,但它们常常受到仿真到现实差距的困扰。本文提出了一种新颖的方法(ZISVFM),通过利用分割一切模型(SAM)的强大零样本能力和自监督视觉Transformer(ViT)的显式视觉表示来解决 UOIS 问题。所提出的框架分三个阶段运行:(1)使用 SAM 从彩色化深度图像生成与物体无关的掩码提议;(2)使用自监督 ViT 的基于注意力的特征细化这些提议,以过滤非物体掩码;(3)应用 K-Medoids 聚类生成点提示,引导 SAM 进行精确的物体分割。在两个基准数据集和一个自采集数据集上的实验验证表明,ZISVFM 在复杂环境中(包括橱柜、抽屉和手持物体等分层设置)表现出优越的性能。我们的源代码可在 https://github.com/Yinmlmaoliang/zisvfm 获取。
引用
@article{arxiv.2502.03266,
title = {ZISVFM: Zero-Shot Object Instance Segmentation in Indoor Robotic Environments with Vision Foundation Models},
author = {Ying Zhang and Maoliang Yin and Wenfu Bi and Haibao Yan and Shaohan Bian and Cui-Hua Zhang and Changchun Hua},
journal= {arXiv preprint arXiv:2502.03266},
year = {2025}
}