中文

ARGOS:智能多摄像头人搜索中的谁、哪里、什么时候

计算机视觉与模式识别 2026-04-15 v1 人工智能 多智能体系统

摘要

我们介绍了 ARGOS,这是第一个将多摄像头人搜索重新表述为需要智能体在信息不对称下进行规划、提问和消除候选者的交互推理问题。ARGOS 智能体接收一段模糊的目击者陈述,必须决定该提问什么、何时调用空间或时间工具,以及如何解释模糊的响应,所有这些都在有限的 turn 预算内进行。推理基于 Spatio-Temporal Topology Graph (STTG) 编码摄像头的连接性和经 empirically 验证的转移时间。该基准包含 2691 个任务,跨越 14 个真实场景,分为三个逐步推进的轨道:语义感知 (Who)、空间推理 (Where) 和 时间推理 (When)。使用四个 LLM backbones 进行实验表明,该基准离求解很近(Track 2 上最佳 TWS: 0.383,Track 3 上: 0.590),且消融实验确认移除特定领域工具会使准确率下降最高可达 49.6 个百分点。

关键词

引用

@article{arxiv.2604.12762,
  title  = {ARGOS: Who, Where, and When in Agentic Multi-Camera Person Search},
  author = {Myungchul Kim and Kwanyong Park and Junmo Kim and In So Kweon},
  journal= {arXiv preprint arXiv:2604.12762},
  year   = {2026}
}

备注

Accepted to CVPR 2026 Workshop on Multimodal Spatial Intelligence (MUSI)