中文

VTAgent:面向证据感知视频 TextVQA 的智能体关键帧锚定

计算机视觉与模式识别 2026-05-07 v1

摘要

视频文本视觉问答(Video TextVQA)旨在通过对视频中出现的视觉文本内容进行推理来回答问题。尽管近期的 Video-LLMs 具有强大的多模态视频理解能力,但它们在现有 Video TextVQA 基准上的表现仍然有限。为了更好地理解这一差距,我们通过逐帧问答进行了上界分析,如果任何一帧得出正确答案就将该样本计为正确,这显著优于直接基于视频的推理,并揭示了巨大的性能差距。结果表明,主要瓶颈在于定位与问题相关的关键证据,而非推理能力本身。基于这一洞察,我们提出了一个问题引导的智能体框架,该框架在回答之前显式地锚定相关关键帧。该方法在免训练设置下有效运行,并持续超越直接视频推理。通过额外的监督微调(SFT)和强化学习(RL),它在各基准上实现了准确率 +12.12 和 ANLS +11.15 的平均提升,创造了新的 SOTA 结果。我们的研究强调了显式关键帧锚定对于推进 Video TextVQA 的关键作用。代码将公开发布。

关键词

引用

@article{arxiv.2605.04870,
  title  = {VTAgent: Agentic Keyframe Anchoring for Evidence-Aware Video TextVQA},
  author = {Haibin He and Maoyuan Ye and Jing Zhang and Juhua Liu and Bo Du},
  journal= {arXiv preprint arXiv:2605.04870},
  year   = {2026}
}