VANE-Bench:面向对话式LMM的视频异常评估基准
计算机视觉与模式识别
2025-03-26 v2
摘要
大型多模态视频模型(Video-LMMs)的最新发展显著增强了我们解释和分析视频数据的能力。尽管具有令人印象深刻的能力,但当前的Video-LMMs尚未针对异常检测任务进行评估,这对于它们在实际场景中的部署至关重要,例如识别深度伪造、被操纵的视频内容、交通事故和犯罪。在本文中,我们介绍了VANE-Bench,这是一个旨在评估Video-LMMs检测和定位视频中异常和不一致性的能力的基准。我们的数据集包含使用现有最先进的文本到视频生成模型合成生成的一系列视频,涵盖了分为五类的各种细微异常和不一致性:非自然变换、非自然外观、穿透、消失和突然出现。此外,我们的基准还包含来自现有异常检测数据集的真实世界样本,重点关注与犯罪相关的异常、非典型行人行为和异常事件。该任务被构建为视觉问答挑战,以衡量模型准确检测和定位视频中异常的能力。我们在此基准任务上评估了九个现有的Video-LMMs,包括开源和闭源模型,发现大多数模型在有效识别细微异常方面遇到困难。总之,我们的研究为Video-LMMs在异常检测领域的当前能力提供了重要见解,突显了我们在评估和改进这些模型以用于实际应用方面工作的重要性。我们的代码和数据可在https://hananshafi.github.io/vane-benchmark/获取。
引用
@article{arxiv.2406.10326,
title = {VANE-Bench: Video Anomaly Evaluation Benchmark for Conversational LMMs},
author = {Rohit Bharadwaj and Hanan Gani and Muzammal Naseer and Fahad Shahbaz Khan and Salman Khan},
journal= {arXiv preprint arXiv:2406.10326},
year = {2025}
}
备注
Accepted to NAACL 2025