中文

SteelBench:在真实工业环境中评估视觉语言模型

计算机视觉与模式识别 2026-07-06 v1

摘要

现有的视频基准测试评估消费者视频、自我中心记录或模拟工业环境中的动作识别。它们没有在真实工业CCTV的视觉和程序条件下测试视觉语言模型,在这种条件下,工人在灰尘、蒸汽、低光照、眩光、遮挡和重叠活动中表现为远处的身影。我们引入了STEELBENCH,一个用于工业监控的诊断基准,它联合评估每个工人的活动识别、安全规则推理和标注来源。SteelBench包含1,345个密集标注的片段,这些片段是从149小时的操作工厂录像和10,024个候选片段中,使用时间去重、类别平衡和可见性感知的分层抽样进行策划的。每个片段都包含密集的每个工人动作标签、PPE属性、空间上下文和安全规则标注。因为模型辅助标注可能会影响后来用于模型评估的标签,SteelBench包含一个来源感知的审计协议。该协议衡量标签影响,评估对真实来源的敏感性,并从专家审查的标签中报告一个人工参考。应用此审计,我们发现未经审计的VLM来源的真实标签可以将同族模型准确率提高多达17个百分点。在来自四个架构家族的九个VLM中,最佳模型仅达到42.6%的动作准确率,而人类基准为84.6%。性能在识别、鲁棒性、校准和安全推理方面也存在差异。即使模型预测了正确的动作,37-58%的情况仍然会产生错误的安全判断,并且没有模型通过5项诊断检查中的超过2项。该数据集在Hugging Face上公开可用。

关键词

引用

@article{arxiv.2607.05264,
  title  = {SteelBench: Evaluating Vision-Language Models in Real-World Industrial Environments},
  author = {Suryanarayana Reddy Yarrabothula and Manisha Chawla and Kunal Sinha and Gagan Raj Gupta and Sashank Lekkala and Ashirvadhan Dosapati and Saikamal Nannuri and Katragadda Ajay RamaSwamy Chowdary Gowtham},
  journal= {arXiv preprint arXiv:2607.05264},
  year   = {2026}
}