迈向可扩展的视频异常检索:一个合成的视频-文本基准
计算机视觉与模式识别
2025-06-03 v1
摘要
视频异常检索旨在使用自然语言查询定位视频中的异常事件,以促进公共安全。然而,现有数据集存在严重局限性:(1) 由于现实世界异常的长尾特性导致的数据稀缺,以及 (2) 阻碍大规模收集的隐私限制。为一次性解决上述问题,我们引入了 SVTA(合成视频-文本异常基准,Synthetic Video-Text Anomaly benchmark),这是首个用于跨模态异常检索的大规模数据集,利用生成模型克服数据可用性挑战。具体而言,我们通过现成的 LLM(大语言模型)收集并生成涵盖 68 个异常类别(例如投掷、盗窃和射击)的视频描述。这些描述涵盖了常见的长尾事件。我们采用这些文本来引导视频生成模型生成多样且高质量的视频。最终,我们的 SVTA 包含 41,315 个视频(1.36M 帧)及配对字幕,涵盖 30 种正常活动(例如站立、行走和运动)和 68 种异常事件(例如跌倒、打架、盗窃、爆炸和自然灾害)。我们采用三种广泛使用的视频-文本检索基线来全面测试我们的 SVTA,揭示了 SVTA 的挑战性及其在评估稳健的跨模态检索方法中的有效性。SVTA 消除了与现实世界异常收集相关的隐私风险,同时保持了真实的场景。数据集演示位于:[https://svta-mm.github.io/SVTA.github.io/]。
引用
@article{arxiv.2506.01466,
title = {Towards Scalable Video Anomaly Retrieval: A Synthetic Video-Text Benchmark},
author = {Shuyu Yang and Yilun Wang and Yaxiong Wang and Li Zhu and Zhedong Zheng},
journal= {arXiv preprint arXiv:2506.01466},
year = {2025}
}