观察、推理、搜索:面向智能体的开放网页视频深度研究基准
计算机视觉与模式识别
2026-05-19 v2 人工智能
摘要
在实际的视频问答场景中,视频通常仅提供局部的视觉线索,而可验证的答案分布在开放的网络上;因此,模型需要同时执行跨帧线索提取、迭代检索和基于多跳推理的验证。为此,我们构建了第一个视频深度研究基准VideoDR。VideoDR聚焦于视频条件下的开放域视频问答,要求跨帧视觉锚点提取、交互式网页检索以及基于视频-网页联合证据的多跳推理;通过严格的人类标注和质量控制,我们获得了涵盖六个语义领域的高质量视频深度研究样本。我们评估了多个封闭源和开源多模态大语言模型,分别在Workflow和Agentic两种范式下,结果显示Agentic并不始终优于Workflow:其收益取决于模型在长链检索中保持初始视频锚点的能力。进一步分析表明,目标漂移和长期一致性是核心瓶颈。总之,VideoDR为研究开放网页环境下的视频智能体提供了系统性基准,揭示了下一代视频深度研究智能体的关键挑战。
引用
@article{arxiv.2601.06943,
title = {Watching, Reasoning, and Searching: A Video Deep Research Benchmark on Open Web for Agentic Video Reasoning},
author = {Chengwen Liu and Xiaomin Yu and Zhuoyue Chang and Zhe Huang and Shuo Zhang and Heng Lian and Jisheng Dang and Rui Xu and Sen Hu and Jianheng Hou and Chengwei Qin and Xiaobin Hu and Kunyi Wang and Zhi Yang and Hao Peng and Hong Peng and Ronghao Chen and Huacan Wang},
journal= {arXiv preprint arXiv:2601.06943},
year = {2026}
}