几何感知语义推理用于无训练视频异常检测
计算机视觉与模式识别
2026-03-17 v1 机器学习
摘要
无训练视频异常检测(VAD)最近作为监督方法的可扩展替代方案出现,但现有方法大多依赖静态提示和几何无关的特征融合。因此,异常推理通常被简化为欧几里得嵌入上的浅层相似性匹配,导致预测不稳定且可解释性有限,尤其是在复杂或层次化结构的场景中。我们提出了 MM-VAD,一个用于无训练VAD的几何感知语义推理框架,将异常检测重新定义为自适应测试时推理而非固定特征比较。我们的方法将来自标题的场景表示投影到双曲空间中以更好地保留层次结构,并通过在冻结的大语言模型上的自适应问答过程进行异常评估。一个轻量级可学习提示在测试时通过无监督置信度-稀疏性目标进行优化,无需更新任何骨干参数即可实现上下文特定的校准。为了进一步将语义预测锚定在视觉证据上,我们引入了协方差感知的 Mahalanobis 精修以稳定跨模态对齐。在四个基准数据集上,MM-VAD 一致优于先前无训练方法,在 XD-Violence 上达到 90.03% AUC,在 UCF-Crime、ShanghaiTech 和 UCSD Ped2 上分别达到 83.24%、96.95% 和 98.81%。我们的结果表明,几何感知表示和自适应语义校准为无训练VAD中的静态欧几里得匹配提供了一个原则性且有效的替代方案。
引用
@article{arxiv.2603.13375,
title = {InfiniteDance: Scalable 3D Dance Generation Towards in-the-wild Generalization},
author = {Ronghui Li and Zhongyuan Hu and Li Siyao and Youliang Zhang and Haozhe Xie and Mingyuan Zhang and Jie Guo and Xiu Li and Ziwei Liu},
journal= {arXiv preprint arXiv:2603.13375},
year = {2026}
}
备注
project page: https://infinitedance.github.io/