InspectVLM:理论上统一,实际中不可靠
计算机视觉与模式识别
2025-08-05 v1
摘要
统一视觉语言模型(VLMs)承诺通过将诸如分类、检测和关键点定位等多个视觉任务重新框架化为单一语言驱动接口来简化计算机视觉管道。这一架构在工业检验领域尤为吸引人,因为管理独立的任务特定模型会引入复杂性、效率低下和维护负担。本文使用 InspectVLM——基于 Florence-2 的 VLM 训练于 InspectMM(我们新的大规模多模态、多任务检验数据集)——批判性地评估了这一统一范式的可行性。虽然 InspectVLM 在图像级分类和结构化关键点任务上表现竭竭,但我们发现它未能匹配传统 ResNet 模型在核心检验指标上的表现。值得注意的是,模型在低提示变异性下表现脆弱,针对细粒度目标检测会产生退化输出,经常默认使用记忆化的语言响应而不顾视觉输入。我们的发现表明,尽管语言驱动的统一提供了概念上的优雅,但当前 VLMs 在视觉 grounding 和鲁棒性方面尚不足以部署在精确关键的工业检验场景中。
关键词
引用
@article{arxiv.2508.01921,
title = {InspectVLM: Unified in Theory, Unreliable in Practice},
author = {Conor Wallace and Isaac Corley and Jonathan Lwowski},
journal= {arXiv preprint arXiv:2508.01921},
year = {2025}
}
备注
Accepted to 2025 ICCV VISION Workshop