中文

MonitorVLM:面向采矿作业安全违规检测的视觉语言框架

计算机视觉与模式识别 2026-03-12 v2 人工智能

摘要

工业事故,特别是发生在岩石采掘和地下采矿等高风险领域,常常是由不安全的工人行为所致。传统的手动检查方法具有耗 labor-intensive、容易出错且不足以应对大规模动态环境的局限,凸显了智能化和自动化安全监测的迫切需求。本文提出 MonitorVLM,一种 novel 视觉语言框架,用于直接从监控视频流中检测安全违规。MonitorVLM 引入了三个关键创新:(1) 包含 9000 个视觉-问题-答案 (VQA) 样本的领域特定违规数据集,涵盖 40 项高频采矿法规,并辅以数据增强和辅助检测线索;(2) 条款筛选 (clause filter, CF) 模块,可动态选择最相关的 Top-K 条款,在保持准确性的同时将推理延迟降低 13.56%;(3) 行为放大器 (behavior magnifier, BM) 模块,可增强工人区域,以提高细粒度动作识别,使精确率提升 3.45%,召回率提升 8.62%。实验结果表明,MonitorVLM 在准确率、召回率和 F1 分数上分别优于 72B 未微调基准模型提升了 22.01%、34.22% 和 28.37%。我们还构建了一个轻量级基于网页的界面,将 MonitorVLM 集成到实际工作流程中,实现了带时间戳的自动违规报告。本研究凸显了多模态大模型在提升采矿及其他领域职业安全监测方面的潜力。

关键词

引用

@article{arxiv.2510.03666,
  title  = {MonitorVLM:A Vision Language Framework for Safety Violation Detection in Mining Operations},
  author = {Jiang Wu and Sichao Wu and Yinsong Ma and Guangyuan Yu and Haoyuan Xu and Lifang Zheng and Jingliang Duan},
  journal= {arXiv preprint arXiv:2510.03666},
  year   = {2026}
}