中文

面向弱监督下Clip级监控异常检测的紧凑型视觉语言模型基准测试

计算机视觉与模式识别 2026-03-17 v1 机器学习

摘要

监控安全检测要求异常检测器在弱监督条件下兼具可靠的Clip级准确率和可预测的逐Clip延迟。本文探讨将紧凑型视觉语言模型(VLM)作为实用检测器用于此场景。构建统一的评估协议,标准化预处理、提示、数据集划分、指标和运行设置,以便在参数高效适配的紧凑型VLM与训练自由的VLM管线及弱监督基线之间进行参数效率的对比。评估涵盖准确率、精确率、召回率、F1分数、ROC-AUC以及平均逐Clip延迟,以综合量化检测质量与效率。通过参数高效适配,紧凑型VLM在准确率上与已建立方法持平,甚至在某些情况下超过,而且保持具竞争力的逐Clip延迟。适配进一步减少了提示敏感性,在共享协议下产生更一致的行为。这些结果表明,参数高效微调使紧凑型VLM能够作为可靠的Clip级异常检测器,实现了准确率与效率之间 favorable 的权衡,并在透明且一致的实验 setup 下发挥作用。

关键词

引用

@article{arxiv.2603.13306,
  title  = {Benchmarking Compact VLMs for Clip-Level Surveillance Anomaly Detection Under Weak Supervision},
  author = {Kirill Borodin and Kirill Kondrashov and Nikita Vasiliev and Ksenia Gladkova and Inna Larina and Mikhail Gorodnichev and Grach Mkrtchian},
  journal= {arXiv preprint arXiv:2603.13306},
  year   = {2026}
}

备注

Published ad MDPI Journal of Imaging (see at https://www.mdpi.com/2313-433X/11/11/400)