中文

适配预训练视觉模型用于新型实例检测与分割

计算机视觉与模式识别 2025-03-06 v3 机器人学

摘要

新型实例检测与分割 (NIDS) 旨在给定每个实例的少量示例后检测和分割新型实例。我们提出了一种统一、简洁且有效的框架 (NIDS-Net),包括对象提议生成、实例模板和提议区域的嵌入创建,以及用于实例标签分配的嵌入匹配。利用最新进展,我们采用 Grounding DINO 和 Segment Anything Model (SAM) 获取具有准确边界框和掩码的对象提议。我们方法的核心是生成高质量的实例嵌入。我们利用来自 DINOv2 ViT 背板的 patch 嵌入的前景特征平均值,然后通过我们引入的权重适配器进行细化。我们在实验中表明,权重适配器可以在其特征空间中局部调整嵌入,并有效限制在少样本设置下的过拟合。此外,权重适配器优化权重以增强实例嵌入在相似性计算中的区分性。这一方法性质使得匹配策略变得简单直接,并带来了显著的性能提升。我们的框架在四个检测数据集上超越了当前最先进的方法,在七个 BOP 挑战核心数据集上的分割任务中表现优于领先的 RGB 方法,并与最佳 RGB-D 方法保持有竞争力。我们还使用来自 Fetch 机器人和 RealSense 相机的真实图像验证了该方法。项目页面: https://irvlutd.github.io/NIDSNet/

关键词

引用

@article{arxiv.2405.17859,
  title  = {Adapting Pre-Trained Vision Models for Novel Instance Detection and Segmentation},
  author = {Yangxiao Lu and Jishnu Jaykumar P and Yunhui Guo and Nicholas Ruozzi and Yu Xiang},
  journal= {arXiv preprint arXiv:2405.17859},
  year   = {2025}
}

备注

Project Page: https://irvlutd.github.io/NIDSNet/