中文

基于基础模型和图神经网络的少样本结构感知机械部件分割

计算机视觉与模式识别 2025-01-20 v1

摘要

本文提出了一种新方法,用于针对具有空间和层次关系的多部件机械进行少样本语义分割。我们的 method 将 foundation models CLIPSeg 和 Segment Anything Model(SAM)与兴趣点检测器 SuperPoint 和图卷积网络(GCN)集成,以准确分割机械部件。通过提供 1 到 25 个已标注样本,我们的 model 在描绘 truck-mounted loading crane 的纯合成数据集上,实现了各层次细节的有效分割。训练时间保持在消费级 GPU 上 5 分钟以内。该 model 在真实数据上的鲁棒性表现出约 92.2 的 qualitative synthetic-to-real generalization J&F 分数。当在 DAVIS 2017 数据集上进行基准测试时,在仅使用 3 个 support samples 的情况下,以 71.5 的 J&F 分数实现了半监督视频分割。这一方法的快速训练时间和对真实数据的有效泛化能力使其成为与机械装备和基础设施交互的自主系统的有价值工具,说明了结合和协调编排基础模型以解决少样本分割任务的潜力。

关键词

引用

@article{arxiv.2501.10080,
  title  = {Few-shot Structure-Informed Machinery Part Segmentation with Foundation Models and Graph Neural Networks},
  author = {Michael Schwingshackl and Fabio Francisco Oberweger and Markus Murschitz},
  journal= {arXiv preprint arXiv:2501.10080},
  year   = {2025}
}

备注

Accepted at Winter Conference on Applications of Computer Vision (WACV) 2025. Code and available at https://github.com/AIT-Assistive-Autonomous-Systems/Hopomop