PANDA:基于代理AI工程的通用视频异常检测
计算机视觉与模式识别
2025-10-29 v2
摘要
视频异常检测(VAD)是由于现实场景的复杂性和多样性而具有挑战性的关键任务。以往方法通常依赖于特定领域的训练数据和手动调整才能应用于新场景和未见的异常类型,导致高劳动成本和有限的泛化能力。因此,我们旨在实现通用VAD,即自动处理任何场景和任何异常类型,而无需训练数据或人工参与。在本工作中,我们提出PANDA,一个基于MLLMs的代理AI工程师。具体而言,我们通过构思四项关键能力来实现PANDA:(1)自适应场景感知策略规划,(2)目标驱动的启发式推理,(3)工具增强的自省反思,(4)自我改进的记忆链。具体地,我们构建了一个自适应场景感知RAG机制,使PANDA能够检索异常特定知识,以进行异常检测策略规划。随后,我们引入一种潜在异常引导的启发式提示策略,以增强推理精度。此外,PANDA采用渐进式反思机制搭配一套上下文感知工具,以在复杂场景中迭代细化决策。最后,记忆链机制使PANDA能够利用历史经验实现持续性能提升。广泛的实验表明,PANDA在多场景、开放集和复杂场景设置下无需训练和人工参与即可实现最先进的性能,验证了其通用性和鲁棒性异常检测能力。代码已发布于https://github.com/showlab/PANDA。
引用
@article{arxiv.2509.26386,
title = {PANDA: Towards Generalist Video Anomaly Detection via Agentic AI Engineer},
author = {Zhiwei Yang and Chen Gao and Mike Zheng Shou},
journal= {arXiv preprint arXiv:2509.26386},
year = {2025}
}
备注
Accepted by NeurIPS 2025