中文

VideoSeek:基于工具引导的长时程视频智能体

计算机视觉与模式识别 2026-03-23 v1 人工智能 计算与语言

摘要

视频智能代理模型已推动了具有挑战性的视频语言任务的进展。然而,大多数智能代理方法仍严重依赖对密集采样视频帧的贪心解析,导致高计算成本。我们提出了VideoSeek,一种利用视频逻辑流程主动寻求答案关键证据的长时程视频智能体。这种洞察使模型能够使用远少于帧数,同时保持甚至改进其视频理解能力。VideoSeek在思考-行动-观察循环中运行,配备设计良好的工具用于收集多粒度视频观察。这种设计使查询感知的探索得以实现,并支持实际的视频理解和推理。实验在四个具有挑战性的视频理解和推理基准上表明,VideoSeek在准确率上优于先前视频代理和独立大型语言模型,同时使用远少于帧数。值得注意的是,VideoSeek在LVBench上相对于其基础模型GPT-5实现了10.2分的绝对提升,同时使用了93%更少的帧数。进一步分析突显了利用视频逻辑流程、强大的推理能力以及工具设计的互补作用的重要性。

关键词

引用

@article{arxiv.2603.20185,
  title  = {VideoSeek: Long-Horizon Video Agent with Tool-Guided Seeking},
  author = {Jingyang Lin and Jialian Wu and Jiang Liu and Ximeng Sun and Ze Wang and Xiaodong Yu and Jiebo Luo and Zicheng Liu and Emad Barsoum},
  journal= {arXiv preprint arXiv:2603.20185},
  year   = {2026}
}

备注

Accepted at CVPR 2026