中文

R3G:面向视觉中心答案生成的推理-检索-重排序框架

计算机视觉与模式识别 2026-04-08 v2 人工智能

摘要

面向VQA的视觉中心检索需要检索图像以提供缺失的视觉线索,并将其整合到推理过程中。然而,选择正确的图像并将其有效整合到模型的推理中仍然具有挑战性。为了应对这一挑战,我们提出了R3G,一个模块化的推理-检索-重排序框架。它首先生成一个简要的推理计划,指定所需的视觉线索,然后采用两阶段策略,先进行粗粒度检索,再进行细粒度重排序,以选择证据图像。在MRAG-Bench上,R3G在六个MLLM骨干网络和九个子场景中提高了准确率,实现了最先进的整体性能。消融实验表明,充分性感知的重排序和推理步骤是互补的,有助于模型既选择正确的图像又充分利用它们。我们在https://github.com/czh24/R3G发布代码和数据。

关键词

引用

@article{arxiv.2602.00104,
  title  = {R3G: A Reasoning--Retrieval--Reranking Framework for Vision-Centric Answer Generation},
  author = {Zhuohong Chen and Zhengxian Wu and Zirui Liao and Shenao Jiang and Hangrui Xu and Yang Chen and Chaokui Su and Xiaoyu Liu and Haoqian Wang},
  journal= {arXiv preprint arXiv:2602.00104},
  year   = {2026}
}