VideoSEAL:通过解耦答案权威性缓解代理式长视频理解中的证据错位
计算机视觉与模式识别
2026-05-14 v1 人工智能
摘要
长视频问答需要在高度冗余内容中定位稀疏、时序分散的视觉证据。虽然当前大型多模态语言模型(MLLMs)在短视频上表现良好,但长视频引入长程搜索与验证,往往需要多轮、代理式交互。我们指出,现有长视频理解(LVU)代理会出现“证据错位”:即产生正确答案,但未由检索或检查的证据支持。为刻画这一失效,我们引入两个诊断(时间导向性和语义导向性),并用之揭示两种放大因素:推理时共享上下文的饱和导致的提示压力,以及训练中仅优化结果的奖励压力。这些发现指向结构性根源:耦合的代理范式混合了长程规划与答案权威性。因此,我们提出解耦规划-检查员框架,将规划与答案权威性分离,并以像素级验证为门控最终答案。跨四个长视频基准测试,我们的框架在答案准确性和证据对齐方面均取得改进,分别在 LVBench 上达到 55.1%,在 LongVideoBench 上达到 62.0%,同时生成可解释的搜索轨迹。此外,解耦架构在增加搜索预算后保持一致扩展,并支持无需重新训练规划器即可插拔式升级 MLLM 主干。代码和模型已公开于 https://github.com/Echochef/VideoSEAL。
引用
@article{arxiv.2605.12571,
title = {VideoSEAL: Mitigating Evidence Misalignment in Agentic Long Video Understanding by Decoupling Answer Authority},
author = {Chenhao Qiu and Yechao Zhang and Xin Luo and Shien Song and Xusheng Liu},
journal= {arXiv preprint arXiv:2605.12571},
year = {2026}
}
备注
Accepted to ICML 2026. 33 pages, 13 figures. Code and models are available at https://github.com/Echochef/VideoSEAL