思考后验证:面向长视频理解的假设-验证多智能体框架
计算机视觉与模式识别
2026-03-06 v1
摘要
长视频理解因视觉冗余、长程时间依赖以及链律推理和检索型智能体积聚语义漂移和关联驱动的错误而具有挑战性。我们认为,长视频推理应始于被动检索,而应以刻意的任务表述开始:模型必须首先阐明对于每个候选答案而言,视频中必须为真的事实。这种以思考后查找原则动机下,我们提出了 VideoHV-Agent 框架,将视频问答问题重新表述为结构化的假设-验证过程。基于视频摘要,Thinker 将答案候选者改写为可测试的假设,Judge 从演化出判别性线索指定必须检查的证据,Verifier 使用局部化、细粒度的视频内容对线索进行 grounding 和测试,Answer 智能体整合已验证的证据产生最终答案。在三个长视频理解基准上的实验表明,VideoHV-Agent 实现了最先进的准确率,同时提供了增强的可解释性、更有逻辑的严谨性以及更低的计算成本。我们将在 https://github.com/Haorane/VideoHV-Agent 上公开代码。
引用
@article{arxiv.2603.04977,
title = {Think, Then Verify: A Hypothesis-Verification Multi-Agent Framework for Long Video Understanding},
author = {Zheng Wang and Haoran Chen and Haoxuan Qin and Zhipeng Wei and Tianwen Qian and Cong Bai},
journal= {arXiv preprint arXiv:2603.04977},
year = {2026}
}
备注
Accepted at CVPR 2026