VERA:基于语言化学习的可解释视频异常检测
人工智能
2025-04-02 v3 计算机视觉与模式识别
机器学习
摘要
视觉语言模型(VLM)的快速发展为视频异常检测(VAD)开辟了新范式:利用 VLM 同时进行异常检测并为决策提供可理解的解释。现有研究往往认为,VAD 所需的复杂推理超出了预训练 VLM 的能力。因此,这些方法要么在推理阶段引入专门的推理模块,要么通过额外的训练依赖指令调优数据集来适配 VLM 以完成 VAD。然而,这些策略往往造成巨大的计算成本或数据标注开销。为解决可解释 VAD 中的这些挑战,本文提出一种称为 VERA 的语言化学习框架,使 VLM 能够无需修改模型参数地完成 VAD。具体而言,VERA 将完成 VAD 所需的复杂推理自动分解为对更简单、更聚焦的引导性问题的反思,这些问题捕捉不同的异常模式。它将这些反思性问题视为可学习的参数,通过数据驱动的语言交互在学习者与优化者 VLM 之间进行优化,使用粗略标注的训练数据。在推理阶段,VERA 将学习到的问题嵌入模型提示中,以引导 VLM 生成段级异常得分,再通过场景和时间上下文的融合,将其细化为帧级得分。在挑战性基准测试上的实验结果表明,VERA 学习到的问题具有高度的可适应性,显著提升了 VLM 在 VAD 任务上的检测性能和可解释性。
引用
@article{arxiv.2412.01095,
title = {VERA: Explainable Video Anomaly Detection via Verbalized Learning of Vision-Language Models},
author = {Muchao Ye and Weiyang Liu and Pan He},
journal= {arXiv preprint arXiv:2412.01095},
year = {2025}
}
备注
Accepted in CVPR 2025