中文

iSafetyBench:面向工业环境安全的视频语言基准

计算机视觉与模式识别 2025-08-15 v2

摘要

视觉语言模型(VLM)的最新进展使其在零样本设置下跨多种视频理解任务展现出令人印象深刻的泛化能力。然而,它们在高风险工业领域(识别常规操作和安全关键异常至关重要)的能力仍未得到充分探索。为填补这一空白,我们引入了iSafetyBench,这是一个专门设计用于评估模型在工业环境中正常和危险场景下性能的新型视频语言基准。iSafetyBench包含来自真实工业环境的1100个视频片段,并标注了涵盖98个常规和67个危险动作类别的开放词汇、多标签动作标签。每个片段都配有用于单标签和多标签评估的多项选择题,从而能够在标准和安全关键背景下对VLM进行细粒度评估。我们在零样本条件下评估了八个最先进的视频语言模型。尽管这些模型在现有视频基准上表现强劲,但它们在iSafetyBench上表现不佳——尤其是在识别危险活动和多标签场景中。我们的结果揭示了显著的性能差距,强调了为工业应用开发更鲁棒、更具安全意识的多模态模型的必要性。iSafetyBench提供了首个此类测试平台,以推动该方向的进展。数据集可在https://github.com/iSafetyBench/data获取。

关键词

引用

@article{arxiv.2508.00399,
  title  = {iSafetyBench: A video-language benchmark for safety in industrial environment},
  author = {Raiyaan Abdullah and Yogesh Singh Rawat and Shruti Vyas},
  journal= {arXiv preprint arXiv:2508.00399},
  year   = {2025}
}

备注

Accepted to VISION'25 - ICCV 2025 workshop