中文

LensWalk:通过规划如何观察视频来实现代理视频理解

计算机视觉与模式识别 2026-03-26 v1 人工智能

摘要

视频的稠密、时序性质为自动化分析带来了深刻挑战。尽管使用强大的视觉-语言模型,但当前的视频理解方法受限于推理与感知之间的本质性脱节:它们依赖于静态、预处理的信息,无法主动从视频中获取原始证据以不断演化的理解为服务。为此,我们引入LensWalk,一个灵活的代理框架,使大型语言模型推理器能够主动控制其自身的视觉观察。LensWalk 建立了一个紧密的 reason-plan-observe 循环,使得代理在每一步动态指定它观察视频的时序范围和抽样密度。通过以这些规格为参数化的多功能视觉-语言模型工具,该代理可以进行广泛的线索扫描、聚焦于特定片段进行事实提取,以及拼接来自多个时刻的证据以进行整体验证。这种设计允许在需求到的情况下逐步获取证据,直接服务于代理不断演化的思考链。无需任何模型微调,LensWalk 在多个模型配方上实现了显著的即插即用性能提升,在LVBench 和 Video-MME 等具有挑战性的长视频基准测试中准确率提升超过5%。我们的分析表明,使代理控制其观察方式是解锁更准确、更稳健且更可解释视频推理的关键。

关键词

引用

@article{arxiv.2603.24558,
  title  = {LensWalk: Agentic Video Understanding by Planning How You See in Videos},
  author = {Keliang Li and Yansong Li and Hongze Shen and Mengdi Liu and Hong Chang and Shiguang Shan},
  journal= {arXiv preprint arXiv:2603.24558},
  year   = {2026}
}

备注

To be published in CVPR 2026