基于视觉语言模型和嵌入分类的监控系统级联多智能体异常检测
计算机视觉与模式识别
2026-01-19 v3 多智能体系统
摘要
智能异常检测需要在动态视觉环境中实现实时性能与语义可解释性之间的平衡。传统方法仅解决这一挑战的局部分解。基于重建的模型在缺乏上下文推理的情况下捕捉低层偏差,目标检测器提供速度但语义有限,大型视觉语言系统在计算成本不可接受时仍提供可解释性。本文引入一种级联多智能体框架,将这些互补范式统一为一个连贯且可解释的架构。早期模块执行重建门控过滤和对象级评估,而高层推理智能体被选择性调用以解释语义上模糊的事件。该系统采用自适应阈值和发布-订阅通信 backbone,实现异步协调和跨异构硬件的可扩展部署。大规模监控数据上的广泛评估表明,所提出的级联结构相较于直接视觉语言推理在延迟上降低了三倍,同时保持高感知保真度(PSNR = 38.3 dB,SSIM = 0.965)和持续的语义标记。该框架超越了传统检测管道,结合了早期退出效率、自适应多智能体推理和可解释异常归因,建立了一个可复现且高效能的可扩展智能视觉监控基础。
引用
@article{arxiv.2601.06204,
title = {Cascading multi-agent anomaly detection in surveillance systems via vision-language models and embedding-based classification},
author = {Tayyab Rehman and Giovanni De Gasperis and Aly Shmahell},
journal= {arXiv preprint arXiv:2601.06204},
year = {2026}
}
备注
Author email changed, Acknowlegement changes