中文

AnyOKP:基于预训练 ViT 的一次性实例感知物体关键点提取

计算机视觉与模式识别 2023-09-18 v1

摘要

面向灵活的以物体为中心的视觉感知,我们提出了一种一次性实例感知物体关键点(OKP)提取方法 AnyOKP,其利用了预训练视觉Transformer(ViT)的强大表征能力,可在从一张支撑图像学习后,对任意类别的多个物体实例提取关键点。我们直接部署现成的预训练 ViT 进行可泛化且可迁移的特征提取,随后进行无需训练的特征增强。基于外观相似性在支撑图像与查询图像中搜索最佳原型对(BPPs),以产生实例不敏感的候选关键点。然后,根据图边上特征分布将所有候选关键点作为顶点的整图划分为子图,最终每个子图代表一个物体实例。AnyOKP 在使用机械臂、移动机器人与手术机器人相机采集的真实物体图像上进行了评估,不仅展示了跨类别灵活性与实例感知能力,也表现出对域偏移与视角变化的显著鲁棒性。

关键词

引用

@article{arxiv.2309.08134,
  title  = {AnyOKP: One-Shot and Instance-Aware Object Keypoint Extraction with Pretrained ViT},
  author = {Fangbo Qin and Taogang Hou and Shan Lin and Kaiyuan Wang and Michael C. Yip and Shan Yu},
  journal= {arXiv preprint arXiv:2309.08134},
  year   = {2023}
}

备注

Submitted to IEEE ICRA 2024 as a contributed paper