中文

面向可解释视频异常检测的知识引导文本推理框架

计算机视觉与模式识别 2025-11-12 v1 人工智能

摘要

我们提出了 Text-based Explainable Video Anomaly Detection(TbVAD),一个面向弱监督视频异常检测的语言驱动框架,通过完全在文本域内完成异常检测和解释。不同于传统 WSVAD 模型依赖显式视觉特征,TbVAD 通过语言表示视频语义,实现可解释且基于知识的推理。该框架包含三个阶段:(1)使用视觉-语言模型将视频内容转换为细粒度描述;(2)通过将描述组织为四个语义槽位(action、object、context、environment)构建结构化知识;(3)生成基于構位的解释,揭示哪些语义因素对异常决策贡献最大。我们在两个公开基准数据集 UCF-Crime 和 XD-Violence 上进行评估,结果表明文本知识推理为真实世界监控场景下的可解释且可靠的异常检测提供了解决方案。

关键词

引用

@article{arxiv.2511.07429,
  title  = {Knowledge-Guided Textual Reasoning for Explainable Video Anomaly Detection via LLMs},
  author = {Hari Lee},
  journal= {arXiv preprint arXiv:2511.07429},
  year   = {2025}
}