针对女性安全的视频异常检测分析:多模态数据集能否提升VAD模型?
计算机视觉与模式识别
2026-05-26 v1
摘要
女性安全和安全是现代社会的首要任务。对女性的犯罪发生在白天也发生在低光条件下。通常,这些事件是通过 operate at lower resolutions 的真实世界监控摄像机捕获的。尽管在CV相关研究方面取得了显著进展,但针对女性安全的视频异常检测(VAD)尚未得到充分关注。现有的视频异常数据集包含光线充足、高分辨率、近景视频,无法代表针对女性的异常,如链条抢夺、跟踪、不当触碰以及其他女性犯罪的隐蔽形式。为解决这些问题,我们提出了ExtrAnom数据集,一个新的多模态基准数据集,包含1001个视频,配有文本描述,500个正常和501个异常,分为5种不同类型的女性中心犯罪。该数据集包含低光(8%)、低分辨率视频(13%)、远景(15%),以及64%的异常视频。它覆盖了跟踪(3.9%)、链条抢夺(17.6%)、绑架(7.3%)、刺杀(2.3%)、骚扰(18.9%)和正常(50%)等异常事件。每个视频配有4个文本注释,包括一个人工生成的描述和三个由大语言模型生成的描述,支持跨模态和基于视觉语言模型(VLM)的验证。创建女性中心数据集的目的是准确检测女性中心异常模式,这些模式是可以肉眼观察到的。该数据集为视觉语言模型提供了足够的支持,以准确生成视频级别的描述。ExtrAnom已针对流行的单模态和多模态VAD数据集(如XD-Violence、UCF-Crime和UCA)进行基准测试,并与SOTA方法进行比较。实验表明,现有数据集不足以训练检测女性中心异常的模型。
引用
@article{arxiv.2605.25806,
title = {An Analysis Focused on Womens Safety: Can VAD Models Be Enhanced by a Multi-modal Dataset?},
author = {Sangeeta and Maddikuntla Sai Prajwal and Debi Prosad Dogra and Kamalakar Vijay Thakare and Hyungjoo Jung and Ig-Jae Kim and Heeseung Choi},
journal= {arXiv preprint arXiv:2605.25806},
year = {2026}
}
备注
7 pages, 6 figures, 4 tables