PrismVAU:面向多模态视频异常理解的提示优化推理系统
计算机视觉与模式识别
2026-01-09 v2 人工智能
摘要
视频异常理解(VAU)扩展了传统的视频异常检测(VAD),不仅局部化异常,还描述和推理其上下文。现有的 VAU 方法通常依赖微调的多模态大语言模型(MLLM)或外部模块(如视频描述器),这会引入高昂的标注成本、复杂的训练管道和高推理开销。本文引入了 PrismVAU,一个轻量且高效的实时 VAU 系统,利用单个即插即用 MLLM 进行异常评分、解释和提示优化。PrismVAU 在两个互补阶段运行:(1)计算通过文本锚点与文本相似性的帧级异常评分的粗糙评分模块;(2)基于系统和用户提示的 MLLM 基于细化模块对异常进行上下文化。文本锚点和提示均通过弱监督的自动提示工程(APE)框架进行优化。大量实验在标准 VAD 数据集上表明,PrismVAU 在不依赖指令调谐、帧级标注和外部模块或密集处理的情况下,交付了具竞争力的检测性能和可解释的异常解释——这是一个高效且实用的面向实际应用的解决方案。
引用
@article{arxiv.2601.02927,
title = {PrismVAU: Prompt-Refined Inference System for Multimodal Video Anomaly Understanding},
author = {Iñaki Erregue and Kamal Nasrollahi and Sergio Escalera},
journal= {arXiv preprint arXiv:2601.02927},
year = {2026}
}
备注
This paper has been accepted to the 6th Workshop on Real-World Surveillance: Applications and Challenges (WACV 2026)