Video-Browser:迈向智能体式开放网络视频浏览
计算机视觉与模式识别
2026-01-19 v2
摘要
自主智能体的发展正在重新定义信息检索,从被动检索过渡到主动的、开放式网络研究。然而,在处理网络上最动态且信息密集的模态——视频时,仍存在显著的模态鸿沟。在本文中,我们首先形式化了智能体式视频浏览任务,并引入了 Video-BrowseComp,这是一个评估开放式智能体浏览任务的基准,该任务强制要求对视频的依赖。我们观察到,当前范式难以调和开放式视频探索的规模与细粒度视觉验证的需求。直接视觉推断(例如 RAG)最大化了感知能力,但产生了过高的上下文成本,而以文本为中心的摘要优化了效率,却经常遗漏准确接地所需的视觉细节。为了解决这个问题,我们提出了 Video-Browser,一种利用金字塔感知的新型智能体,通过廉价的元数据进行过滤,仅在必要时使用昂贵的视觉感知进行放大。实验表明,与直接视觉推断相比,我们的方法实现了 37.5% 的相对提升,同时将 token 消耗减少了 58.3%,为可验证的开放网络视频研究奠定了基础。我们在 {https://anonymous.4open.science/r/VideoBrowser} 和 {https://github.com/chrisx599/Video-Browser} 开源了所有代码与基准。
引用
@article{arxiv.2512.23044,
title = {Video-Browser: Towards Agentic Open-web Video Browsing},
author = {Zhengyang Liang and Yan Shu and Xiangrui Liu and Minghao Qin and Kaixin Liang and Nicu Sebe and Zheng Liu and Lizi Liao},
journal= {arXiv preprint arXiv:2512.23044},
year = {2026}
}