中文

基于协同推理的智能体时空 grounding

计算机视觉与模式识别 2026-02-17 v1 人工智能

摘要

时空视频 grounding(Spatio-Temporal Video Grounding, STVG)旨在给定文本查询后检索目标对象或人员在视频中的时空管道。大多数现有方法在预测的时空范围内进行帧级空间定位,导致冗余计算、强 supervision 要求和有限的泛化能力。弱监督变体缓解了标注成本,但仍受限于数据级别的训练-拟合范式,性能不佳。为此,我们提出Agentic Spatio-Temporal Grounder(ASTG)框架,用于STVG towards开放世界和无训练场景。具体而言,基于现代多模态大语言模型(Multimodal Large Language Models, MLLMs)构建的两个专用智能体——空间推理智能体(SRA, Spatial Reasoning Agent)和时序推理智能体(TRA, Temporal Reasoning Agent)——协作检索目标管道。ASTG遵循提议-评估范式,恰当地解耦时空推理,自动化管道提取、验证和时序定位过程。凭借专用视觉记忆和对话上下文,检索效率得到显著提升。实验在流行基准数据集上表明,我们的方法优于现有弱监督和零样本方法,性能与一些完全监督方法相当。

关键词

引用

@article{arxiv.2602.13313,
  title  = {Agentic Spatio-Temporal Grounding via Collaborative Reasoning},
  author = {Heng Zhao and Yew-Soon Ong and Joey Tianyi Zhou},
  journal= {arXiv preprint arXiv:2602.13313},
  year   = {2026}
}