中文

SOVABench:面向多模态大型语言模型的车辆监控动作检索基准

计算机视觉与模式识别 2026-01-12 v2

摘要

事件的自动识别与循环行为分析对视频监控至关重要。然而,大多数现有的基于内容的视频检索基准关注场景级相似性,并未评估监控所需的动作判别。为弥补这一差距,我们引入 SOVABench(Surveillance Opposite Vehicle Actions Benchmark,监控相反车辆动作基准),这是一个基于监控录像构建的、以车辆相关动作为中心的真实世界检索基准。SOVABench 定义了两种评估协议(间对与内对),以评估跨动作判别与时间方向理解。尽管动作区分对人类观察者通常很直观,但我们的实验表明,这对 SOTA 视觉与多模态模型仍具挑战性。利用多模态大型语言模型的视觉推理与指令遵循能力,我们提出了一种无需训练的框架,从 MLLM 生成的图像与视频描述中产生可解释嵌入。该框架在 SOVABench 以及对比视觉语言模型常失败的若干空间与计数基准上取得了强劲表现。构建该基准的代码、标注与说明已公开可用。

关键词

引用

@article{arxiv.2601.04824,
  title  = {SOVABench: A Vehicle Surveillance Action Retrieval Benchmark for Multimodal Large Language Models},
  author = {Oriol Rabasseda and Zenjie Li and Kamal Nasrollahi and Sergio Escalera},
  journal= {arXiv preprint arXiv:2601.04824},
  year   = {2026}
}

备注

This work has been accepted at Real World Surveillance: Applications and Challenges, 6th (in WACV Workshops)