面向弱监督下Clip级监控异常检测的紧凑型视觉语言模型基准测试
计算机视觉与模式识别
2026-03-17 v1 机器学习
摘要
监控安全检测要求异常检测器在弱监督条件下兼具可靠的Clip级准确率和可预测的逐Clip延迟。本文探讨将紧凑型视觉语言模型(VLM)作为实用检测器用于此场景。构建统一的评估协议,标准化预处理、提示、数据集划分、指标和运行设置,以便在参数高效适配的紧凑型VLM与训练自由的VLM管线及弱监督基线之间进行参数效率的对比。评估涵盖准确率、精确率、召回率、F1分数、ROC-AUC以及平均逐Clip延迟,以综合量化检测质量与效率。通过参数高效适配,紧凑型VLM在准确率上与已建立方法持平,甚至在某些情况下超过,而且保持具竞争力的逐Clip延迟。适配进一步减少了提示敏感性,在共享协议下产生更一致的行为。这些结果表明,参数高效微调使紧凑型VLM能够作为可靠的Clip级异常检测器,实现了准确率与效率之间 favorable 的权衡,并在透明且一致的实验 setup 下发挥作用。
引用
@article{arxiv.2603.13306,
title = {Benchmarking Compact VLMs for Clip-Level Surveillance Anomaly Detection Under Weak Supervision},
author = {Kirill Borodin and Kirill Kondrashov and Nikita Vasiliev and Ksenia Gladkova and Inna Larina and Mikhail Gorodnichev and Grach Mkrtchian},
journal= {arXiv preprint arXiv:2603.13306},
year = {2026}
}
备注
Published ad MDPI Journal of Imaging (see at https://www.mdpi.com/2313-433X/11/11/400)