中文

ZERO:面向工业应用的、支持多模态提示的视觉基础模型

计算机视觉与模式识别 2025-11-10 v4 人工智能

摘要

基础模型已经彻底改变了人工智能,但由于缺乏高质量、特定领域的数据集,它们在现实工业环境中的零样本部署仍然面临挑战。为了弥合这一差距,Superb AI 推出了 ZERO,这是一个面向工业应用的视觉基础模型,它利用多模态提示(文本和视觉)实现无需重新训练的泛化。ZERO 在来自专有十亿级工业数据集的、紧凑且具有代表性的 90 万个标注样本上进行训练,在 LVIS-Val 等学术基准上表现出具有竞争力的性能,并在 37 个不同的工业数据集上显著优于现有模型。此外,ZERO 在 CVPR 2025 目标实例检测挑战赛中获得第二名,并在基础小样本目标检测挑战赛中获得第四名,突显了其在最少的适应和有限数据下的实际可部署性和泛化能力。据我们所知,ZERO 是首个明确为特定领域、零样本工业应用构建的视觉基础模型。

关键词

引用

@article{arxiv.2507.04270,
  title  = {ZERO: Industry-ready Vision Foundation Model with Multi-modal Prompts},
  author = {Sangbum Choi and Kyeongryeol Go and Taewoong Jang},
  journal= {arXiv preprint arXiv:2507.04270},
  year   = {2025}
}

备注

9 pages, 2 figures