FineVAU:面向人类导向的细粒度视频异常理解基准
计算机视觉与模式识别
2026-02-24 v2
摘要
视频异常理解(VAU)是聚焦于描述视频中异常情况的新兴任务。尽管兴趣日益增长,但VAU的评估仍是开放挑战。现有基准依赖n-gram基于指标(如BLEU、ROUGE-L)或基于LLM的评估。前者未能捕捉LVLm响应中富有表现力、自由形式且以视觉为导向的特性,而后者则侧重于评估语言质量而非事实相关性,常导致主观判断与人类感知不一致。在本工作中,我们提出FineVAU,一个新的VAU基准,将关注力度转向对异常视频进行富有深度、细粒度且领域特定的理解。我们将VAU形式化为三层次问题,目标是全面理解异常视频中关键描述性要素:事件(What)、参与实体(Who)和位置(Where)。我们的基准引入了a) FVScore——一种新的、与人类对齐的评估指标,用于评估LVLm答案中关键视觉要素的存在,提供可解释的细粒度反馈;以及b) FineW3——一个通过结构化且完全自动化的程序筛选而来、将现有人类标注补充为高质量细粒度视觉信息的新型数据集。人类评估表明,我们提出的指标在与当前方法相比,更能与人类对异常视频的感知保持更强的对齐性。在FineVAU上的详细实验揭示了LVLm在感知需要空间和细粒度时序理解的异常事件方面的关键局限,尽管在粗粒度、静态信息以及具有强视觉线索的事件上表现良好。
引用
@article{arxiv.2601.17258,
title = {FineVAU: A Novel Human-Aligned Benchmark for Fine-Grained Video Anomaly Understanding},
author = {João Pereira and Vasco Lopes and João Neves and David Semedo},
journal= {arXiv preprint arXiv:2601.17258},
year = {2026}
}
备注
Accepted at AAAI 2026