检索增强感知:高分辨率图像感知与视觉 RAG 的结合
计算机视觉与模式识别
2025-05-23 v2 计算与语言
摘要
高分辨率(HR)图像感知是多模态大语言模型(MLLM)中的关键挑战。为克服现有方法的局限,本文摒弃了先前专用的启发式方法,通过增强 MLLM 的长上下文能力来重新审视 HR 感知的最基本思想,这一增强受到近期通用 LLM 中检索增强生成(RAG)等长上下文技术进展的驱动。为此,本文首次探索了利用 RAG 解决 HR 感知挑战的研究。具体而言,我们提出了检索增强感知(RAP),一个无需训练的框架,通过提出的空间感知布局检索并融合相关图像块,同时保留空间上下文。为适应不同任务,提出的检索探索搜索(RE-Search)根据模型置信度和检索分数动态选择最优图像块数量。在 HR 基准测试上的实验结果证明了 RAP 的显著有效性,LLaVA-v1.5-13B 在 Bench 上实现了 43% 的提升,在 HR-Bench 上实现了 19% 的提升。
引用
@article{arxiv.2503.01222,
title = {Retrieval-Augmented Perception: High-Resolution Image Perception Meets Visual RAG},
author = {Wenbin Wang and Yongcheng Jing and Liang Ding and Yingjie Wang and Li Shen and Yong Luo and Bo Du and Dacheng Tao},
journal= {arXiv preprint arXiv:2503.01222},
year = {2025}
}