用于视频异常检测的带有门控上下文聚合的前向一致性学习
计算机视觉与模式识别
2026-05-26 v1
摘要
作为公共安全的关键要素,视频异常检测(VAD)旨在测量实时监控系统中各种事件偏离正常模式的程度。然而,大多数现有的 VAD 方法依赖大规模模型以追求极致的准确性,限制了其在资源受限的边缘设备上的可行性。此外,主流的基于预测的 VAD 仅使用单帧未来预测误差来检测异常,忽略了来自更长期时间前向信息的更丰富约束。在本文中,我们引入了 FoGA,一个轻量级的 VAD 模型,它执行带有门控上下文聚合的前向一致性学习,包含约 2M 参数,专为潜在的边缘设备量身定制。具体而言,我们提出了一种基于 Unet 的方法,对连续帧执行特征提取以生成即时预测和前向预测。然后,我们在跳跃连接中引入门控上下文聚合模块,以在同一空间尺度上动态融合编码器和解码器特征。最后,模型通过新颖的前向一致性损失进行联合优化,并采用混合异常测量策略来整合来自即时帧和前向帧的误差,以实现更准确的检测。大量实验证明了所提出方法的有效性,其性能大大优于最先进的竞争方法,运行速度高达 155 FPS。因此,我们的 FoGA 在性能和效率指标之间实现了出色的权衡。
引用
@article{arxiv.2601.18135,
title = {Forward Consistency Learning with Gated Context Aggregation for Video Anomaly Detection},
author = {Jiahao Lyu and Minghua Zhao and Xuewen Huang and Yifei Chen and Shuangli Du and Jing Hu and Cheng Shi and Zhiyong Lv},
journal= {arXiv preprint arXiv:2601.18135},
year = {2026}
}
备注
It has been submitted to the KBS journal