中文

工业合成分段预训练

计算机视觉与模式识别 2025-05-21 v2

摘要

在真实图像数据集上进行预训练已被广泛证明有效,用于提高实例分段性能。然而,工业应用面临两个关键挑战:(1)法律和伦理限制,例如 ImageNet 禁止商业用途;(2)由于网络图像与工业图像之间的领域差异,迁�移性有限。即便是最近的视觉基础模型,包括分段任何模型(SAM),在工业环境中也表现出显著的性能下降。这些挑战提出了关键性问题:我们能否在不依赖真实图像或人工标注的情况下构建面向工业应用的视觉基础模型?以及,这类模型能否在工业数据集上超越甚至经过微调的 SAM?为回答这些问题,我们提出了基于公式驱动的监督学习(FDSL)的实例核心分段数据集(InsCore),这是一套用于合成预训练的数据集。InsCore 生成完全标注的实例分段图像,反映工业数据的关键特征,包括复杂的遮挡、稠密的层次掩码以及多样化的非刚性形状,这与典型的网络图像有所不同。与以往方法不同,InsCore 无需真实图像或人工标注。在五个工业数据集上的实验表明,使用 InsCore 预训练的模型在 COCO 和 ImageNet-21k 上的模型,以及经过微调的 SAM 均表现出更佳的实例分段性能,平均提升 6.2 分。这一成果仅使用 10 万张合成图像即可实现,超过 SA-1B 数据集中 1100 万张图像的 100 倍,显示了该方法的数据效率。这些发现将 InsCore 定位为工业应用的实用且无许可证限制的视觉基础模型。

关键词

引用

@article{arxiv.2505.13099,
  title  = {Industrial Synthetic Segment Pre-training},
  author = {Shinichi Mae and Ryousuke Yamada and Hirokatsu Kataoka},
  journal= {arXiv preprint arXiv:2505.13099},
  year   = {2025}
}