循规矩行动:基于大语言模型的视频异常检测推理
计算机视觉与模式识别
2024-07-23 v2
摘要
视频异常检测(VAD)是安防监控和自动驾驶等应用领域的关键技术,但现有方法对检测缺乏解释性,阻碍了其在实际场景中的广泛应用。本文提出一种基于推理框架的方法进行 VAD。尽管大语言模型(LLM)展现出革命性的推理能力,但我们发现其直接用于 VAD 仍有不足。具体而言,LLM 内置的知识侧重于通用语境,可能无法适用于每一种具体的实际 VAD 场景,从而导致灵活性和准确性不足。为此,我们提出一种名为 AnomalyRuler 的新型基于规则的 VAD 推理框架。AnomalyRuler 包含两个主要阶段:归纳与演绎。在归纳阶段,LLM 接收少量正常参考样本并总结这些正常模式,以诱导出一组用于检测异常的规则。在演绎阶段,遵循所诱导出的规则对测试视频中的异常帧进行识别。此外,我们设计了规则聚合、感知平滑和鲁棒推理策略,以进一步提升 AnomalyRuler 的鲁棒性。AnomalyRuler 是首个针对单类 VAD 任务的推理方法,仅需少量正常样本即可实现检测,无需完整训练,从而支持快速适配各种 VAD 场景。广泛的实验表明,AnomalyRuler 在四个 VAD 数据集上实现了最先进的检测性能和推理能力。AnomalyRuler 已开源发布,地址为:https://github.com/Yuchen413/AnomalyRuler。
关键词
引用
@article{arxiv.2407.10299,
title = {Follow the Rules: Reasoning for Video Anomaly Detection with Large Language Models},
author = {Yuchen Yang and Kwonjoon Lee and Behzad Dariush and Yinzhi Cao and Shao-Yuan Lo},
journal= {arXiv preprint arXiv:2407.10299},
year = {2024}
}
备注
Accepted at European Conference on Computer Vision (ECCV) 2024