TRACES:用于实时视频异常检测的时空记忆与情境嵌入
计算机视觉与模式识别
2025-11-04 v1 人工智能
摘要
视频异常往往取决于可用且随时间演化的情境信息。在不同情境下,某些非异常动作可能在另一些情境下表现为异常。然而,大多数异常检测器并未注意到此类情境,严重限制了其在新实际情境中泛化的能力。我们的工作针对需要通过实时关联时序特征与视觉嵌入与文本记忆痕迹来学习适应性检测新事件的情境感知零样态异常检测挑战。我们的方案定义了一个记忆增强的管道,将时序信号与视觉嵌入进行cross-attention关联,并通过情境相似度评分实现实时零样态异常分类。我们在UCF-Crime上实现了90.4%的AUC,在XD-Violence上实现了83.67%的AP,刷新了零样态模型的最新SOTA。该模型在高精度和可解释性下实现了实时推理,为部署做好了准备。我们展示,通过融合cross-attention时序融合与情境记忆,我们实现了高保真度异常检测,为将零样态模型应用于实际监控和基础设施监测迈出了一步重要的步伐。
引用
@article{arxiv.2511.00580,
title = {TRACES: Temporal Recall with Contextual Embeddings for Real-Time Video Anomaly Detection},
author = {Yousuf Ahmed Siddiqui and Sufiyaan Usmani and Umer Tariq and Jawwad Ahmed Shamsi and Muhammad Burhan Khan},
journal= {arXiv preprint arXiv:2511.00580},
year = {2025}
}
备注
10 pages, 5 figures