中文

ForeSea:面向视频监控的基于多模态查询的 AI 犯罪搜索系统

计算机视觉与模式识别 2026-03-25 v1

摘要

尽管已有数十年的工作,监控系统仍在跨长时间、多摄像机的视频中寻找特定目标方面存在挑战。以前的方法——跟踪管道、基于 CLIP 的模型和 VideoRAG——需要大量手动过滤,只能捕获浅层属性,无法进行时间推理。现实中的搜索本质上是多模态的(例如:“该何时加入冲突?”配以人物图像),但这一设定仍未得到充分探索。此外,目前没有针对这一设定的正式基准测试——即带有多模态查询的视频测试集。为填补这一空白,我们引入了 ForeSeaQA,这是一个新基准,专为视频问答设计,支持图像与文本查询并标注关键事件的时间戳。该数据集由长时段监控录像足球多样化的多模态问题,系统评估检索、时间定位和现实犯罪条件下的多模态推理。除此基准之外,我们提出了 ForeSea,一个 AI 犯罪搜索系统,采用 3 阶段、可插拔的管道。(1) 跟踪模块过滤无关录像;(2) 多模态嵌入模块索引剩余片段;(3) 在推理期间,系统检索前 K 个候选片段供 Video 大语言模型 (VideoLLM) 用于回答查询并定位事件。在 ForeSeaQA 上,ForeSea 的准确率提高了 3.5%,时间 IoU 提升了 11.0。据我们了解,ForeSeaQA 是首个支持复杂多模态查询并实现精确时间定位的基准,ForeSea 是首个为此设定优化的 VideoRAG 系统。

关键词

引用

@article{arxiv.2603.22872,
  title  = {ForeSea: AI Forensic Search with Multi-modal Queries for Video Surveillance},
  author = {Hyojin Park and Yi Li and Janghoon Cho and Sungha Choi and Jungsoo Lee and Taotao Jing and Shuai Zhang and Munawar Hayat and Dashan Gao and Ning Bi and Fatih Porikli},
  journal= {arXiv preprint arXiv:2603.22872},
  year   = {2026}
}