中文

QVAD: 一种以问题为中心的智能体框架,用于高效且无需训练的视频异常检测

计算机视觉与模式识别 2026-04-06 v1

摘要

视频异常检测(VAD)是计算机视觉领域的一项基础性挑战,尤其是由于异常的开集特性。尽管近期利用视觉语言模型(VLMs)的无需训练方法已展现出前景,但它们通常依赖大规模、资源密集型的基础模型来弥补静态提示的模糊性。我们认为,VAD 的瓶颈不一定是模型容量,而在于查询的静态性质。我们提出了 QVAD,一种以问题为中心的智能体框架,将 VLM-LLM 交互视为动态对话。通过基于视觉上下文迭代优化查询,我们的 LLM 智能体引导较小的 VLMs 产生高保真度的描述和精确的语义推理,而无需参数更新。这种"提示更新"机制有效释放了轻量模型的潜在能力,使其在 UCF-Crime、XD-Violence 和 UBNormal 数据集上以竞争方法所需参数的一小部分即可达到最先进的性能。我们进一步在单场景 ComplexVAD 数据集上展示了卓越的泛化能力。关键的是,QVAD 以极小的内存占用实现了高推理速度,使先进的 VAD 能力可部署于资源受限的边缘设备。

关键词

引用

@article{arxiv.2604.03040,
  title  = {QVAD: A Question-Centric Agentic Framework for Efficient and Training-Free Video Anomaly Detection},
  author = {Lokman Bekit and Hamza Karim and Nghia T Nguyen and Yasin Yilmaz},
  journal= {arXiv preprint arXiv:2604.03040},
  year   = {2026}
}