探索为何及如何:视频异常因果理解的多维基准
计算机视觉与模式识别
2024-12-11 v1 人工智能
摘要
近期视频异常理解 (VAU) 的进展为诸多领域(如交通监控和工业自动化)的突破性应用开辟了道路。尽管当前的 VAU 基准主要侧重于异常的检测和定位,但我们致力于深入探讨 VAU 的实际方面,通过回答三个基本问题:"异常发生了什么?"、"为什么会这样?"、"这异常事件有多严重?"。为此,我们引入了一个用于探索视频异常因果理解的综合基准,即 ECVA。该基准经过精心设计,每个视频都伴随详细的人类注释。具体而言,ECVA 的每个实例都包括三组人类注释,以指示异常的"是什么"、"为什么"和"如何大",包括 1) 异常类型、开始和结束时间以及事件描述,2) 异常原因的自然语言解释,以及 3) 反映异常影响的自由文本。建立在此基础上,我们提出了一种新颖的基于提示的方法,可作为应对 ECVA 所提出的复杂挑战的基准方法。我们利用"硬提示"引导模型关注与视频异常片段相关的关键部分,并利用"软提示"在这些异常片段内建立时间和空间关系。此外,我们提出了 AnomEval,这是一种专为 ECVA 数据集设计的特殊评估指标,旨在与人类判断标准紧密一致。该指标利用 ECVA 数据集的独特特征,为对各种视频大型语言模型提供更全面可靠的评估。我们通过严格的实验分析展示了该方法的有效性,并阐明了进一步探索视频异常因果理解的可能之路。
引用
@article{arxiv.2412.07183,
title = {Exploring What Why and How: A Multifaceted Benchmark for Causation Understanding of Video Anomaly},
author = {Hang Du and Guoshun Nan and Jiawen Qian and Wangchenhui Wu and Wendi Deng and Hanqing Mu and Zhenyan Chen and Pengxuan Mao and Xiaofeng Tao and Jun Liu},
journal= {arXiv preprint arXiv:2412.07183},
year = {2024}
}
备注
Submitted to IEEE Transactions on Pattern Analysis and Machine Intelligence. arXiv admin note: substantial text overlap with arXiv:2405.00181