文本引导的细粒度视频异常理解
计算机视觉与模式识别
2026-04-01 v3
摘要
视频中的细微异常事件常表现为被常规异常检测系统忽略的微弱时空线索。现有视频异常检测方法通常提供粗糙的二元异常决策,而缺乏可解释的证据;大型视觉语言模型(LVLMs)可生成文本判断但缺乏对细微视觉信号的精确定位。为解决这一问题,我们提出了 T-VAU(Text-guided Fine-Grained Video Anomaly Understanding)框架,将细微异常证据嵌入多模态推理中。具体地,我们引入异常热图解码器(AHD),执行视觉-文本特征对齐,从中间视觉表示中提取像素级时空异常热图。我们进一步设计了区域感知异常编码器(RAE),将这些热图转换为结构化提示嵌入,使 LVLM 能够在统一的推理管道中完成异常检测、定位和语义解释。为支持细粒度监督,我们构建了一个基于 ShanghaiTech 和 UBnormal 的目标级细粒度视频文本异常数据集,包含对象外观、定位和运动轨迹的详细注释。广泛的实验表明,T-VAU 在两个基准数据集上显著提高了异常定位和文本推理性能,实现了强大的 BLEU-4 指标和是/否决策准确率,同时为异常理解提供了可解释的像素级时空证据。代码将在 https://github.com/momiji-bit/T-VAU 提供。
引用
@article{arxiv.2511.00524,
title = {Text-guided Fine-Grained Video Anomaly Understanding},
author = {Jihao Gu and Kun Li and He Wang and Kaan Akşit},
journal= {arXiv preprint arXiv:2511.00524},
year = {2026}
}
备注
Accepted by CVPR 2026 SVC Workshop