中文

RobustVisRAG: 视觉退化下因果感知的基于视觉的检索增强生成

计算机视觉与模式识别 2026-03-27 v4

摘要

基于视觉的检索增强生成(VisRAG)利用视觉语言模型(VLM)联合检索相关视觉文档,并基于多模态证据生成有依据的答案。然而,当视觉输入受到模糊、噪声、低光照或阴影等失真影响时,现有VisRAG模型的性能会下降,因为语义和退化因素在预训练的视觉编码器中纠缠在一起,导致检索和生成阶段均出现错误。为解决这一局限,我们引入了RobustVisRAG,一个因果引导的双路径框架,它在保持效率和零样本泛化能力的同时,提升了VisRAG的鲁棒性。RobustVisRAG使用非因果路径通过单向注意力捕获退化信号,并使用因果路径在这些信号的引导下学习纯净的语义。结合所提出的非因果失真建模和因果语义对齐目标,该框架强制实现了语义与退化之间的清晰分离,从而在具有挑战性的视觉条件下实现稳定的检索和生成。为了评估在现实条件下的鲁棒性,我们引入了Distortion-VisRAG数据集,这是一个大规模基准测试,包含跨七个领域的合成和真实退化文档,涵盖12种合成失真类型和5种真实失真类型,全面反映了实际的视觉退化情况。实验结果表明,在真实世界退化条件下,RobustVisRAG在检索、生成和端到端性能上分别提升了7.35%、6.35%和12.40%,同时在干净输入上保持了相当的准确率。

关键词

引用

@article{arxiv.2602.22013,
  title  = {RobustVisRAG: Causality-Aware Vision-Based Retrieval-Augmented Generation under Visual Degradations},
  author = {I-Hsiang Chen and Yu-Wei Liu and Tse-Yu Wu and Yu-Chien Chiang and Jen-Chien Yang and Wei-Ting Chen},
  journal= {arXiv preprint arXiv:2602.22013},
  year   = {2026}
}

备注

Accepted by CVPR2026; Project Page: https://robustvisrag.github.io