UAL-Bench:面向异常活动定位的首个综合基准
计算机视觉与模式识别
2025-03-24 v1 计算与语言
摘要
在视频中定位人类错误或监控事件等异常活动具有实际意义。然而,当前的视频理解模型在定位这些异常事件时表现不佳,可能是由于其预训练数据集中对异常事件的表示不足。为探索基础模型在异常活动定位方面的能力,我们介绍了UAL-Bench——一个面向异常活动定位的综合基准,包含三个视频数据集:UAG-OOPS、UAG-SSBD、UAG-FunQA,以及一个指令微调数据集:OOPS-UAG-Instruct,以提升模型能力。UAL-Bench评估了三种方法:视频语言模型(Vid-LLMs)、指令微调Vid-LLMs,以及一种新型的视觉语言模型与大语言模型集成方法(VLM-LLM)。我们的结果表明,VLM-LLM方法在定位短时段异常事件以及预测其发生时间(起始时间)方面优于Vid-LLMs。我们还提出了新的评估指标R@1,TD <= p,以解决现有评估方法的局限性。我们的发现突显了长时段视频(尤其是自闭症诊断场景)所带来的挑战,以及在定位技术方面仍需进一步进步的必要性。我们的工作不仅为异常活动定位提供了基准,还概述了现有基础模型面临的关键挑战,指明了未来研究方向。
引用
@article{arxiv.2410.01180,
title = {UAL-Bench: The First Comprehensive Unusual Activity Localization Benchmark},
author = {Hasnat Md Abdullah and Tian Liu and Kangda Wei and Shu Kong and Ruihong Huang},
journal= {arXiv preprint arXiv:2410.01180},
year = {2025}
}