VISOR:基于迭代搜索与超视野推理的代理式视觉检索增强生成框架
计算机视觉与模式识别
2026-04-13 v1 人工智能
摘要
视觉检索增强生成(VRAG)使视觉语言模型能够检索并处理富有视觉信息的文档。为解决需要多步推理的复杂查询,代理式VRAG系统在检索与推理之间交替进行。然而,现有代理式VRAG面临两个关键瓶颈:(1)视觉证据稀疏:关键证据散落在不同页面却被独立处理,阻碍跨页面推理;此外,细粒度的图像内证据需要精确的视觉动作,错误使用会降低检索质量;(2)长程搜索漂移:检索页面中积累的视觉标记稀释上下文,导致代理人偏离搜索目标。为应对这些挑战,我们提出VISOR(Visual Retrieval-Augmented Generation via Iterative Search and Over-horizon Reasoning),一个统一的单代理框架。VISOR具备用于渐进式跨页面推理的结构化证据空间,以及用于管理视觉动作的视觉动作评估与纠正机制。此外,我们引入具有滑动窗口和意图注入的动态轨迹,以缓解搜索漂移。它们在证据空间中锚定位置,同时丢弃早期的原始交互,防止视觉标记压倒上下文。我们采用基于GRPO的强化学习管道进行训练,针对动态上下文重构设计了状态掩码和信用分配。大量实验表明,VISOR在ViDoSeek、SlideVQA和MMLongBench上的长程视觉推理任务实现了超越现有方法的卓越效率与性能。
引用
@article{arxiv.2604.09508,
title = {VISOR: Agentic Visual Retrieval-Augmented Generation via Iterative Search and Over-horizon Reasoning},
author = {Yucheng Shen and Jiulong Wu and Jizhou Huang and Dawei Yin and Lingyong Yan and Min Cao},
journal= {arXiv preprint arXiv:2604.09508},
year = {2026}
}