中文

无需真实异常:MLLM 实现的零样本视频异常检测

计算机视觉与模式识别 2026-03-24 v4 人工智能

摘要

视频异常数据收集与检测长期以来都是一个因稀有发生和时空稀缺性而具有挑战性的问题。由于数据集多样性有限和对语境依赖性异常语义理解不足,现有视频异常检测(VAD)方法在开放世界场景中表现不佳。为此,我们提出 LAVIDA,一个端到端的零样本视频异常检测框架。LAVIDA 采用异常暴露抽样器将分割后的对象转换为伪异常,以增强模型对未见异常类别的适应性。它进一步集成了大型多模态语言模型(MLLM)以增强语义理解能力。此外,我们设计了基于反向注意力的 token 压缩方法,以处理异常模式的时空稀缺性并降低计算成本。训练过程仅在伪异常上进行,不使用任何 VAD 数据。在四个基准 VAD 数据集上的评估表明,LAVIDA 在零样本设置下在帧级和像素级异常检测中实现了最先进性能。我们的代码已公开于 https://github.com/VitaminCreed/LAVIDA。

关键词

引用

@article{arxiv.2602.19248,
  title  = {No Need For Real Anomaly: MLLM Empowered Zero-Shot Video Anomaly Detection},
  author = {Zunkai Dai and Ke Li and Jiajia Liu and Jie Yang and Yuanyuan Qiao},
  journal= {arXiv preprint arXiv:2602.19248},
  year   = {2026}
}

备注

Accepted by CVPR 2026