中文

SV-RAG:面向长文档理解的MLLM LoRA上下文适配

计算机视觉与模式识别 2025-03-04 v2

摘要

多模态大语言模型(MLLM)在文本丰富图像理解方面最近取得了巨大进展,但它们仍难以处理复杂、多页的视觉丰富文档。使用文档解析器进行检索增强生成的传统方法存在性能和效率限制,而直接向MLLM呈现所有页面会导致效率低下,尤其是在页面冗长时。本文提出了一个名为**自视觉检索增强生成(SV-RAG)**的新框架,可拓展任意MLLM的视野以支持长文档理解。我们证明**MLLM本身可以作为有效的多模态检索器**来获取相关页面,并基于这些页面回答用户问题。SV-RAG通过两个特定的MLLM适配器实现,一个用于证据页面检索,另一个用于问答。实验结果在公开基准上达到最先进性能,证明了SV-RAG的有效性。

关键词

引用

@article{arxiv.2411.01106,
  title  = {SV-RAG: LoRA-Contextualizing Adaptation of MLLMs for Long Document Understanding},
  author = {Jian Chen and Ruiyi Zhang and Yufan Zhou and Tong Yu and Franck Dernoncourt and Jiuxiang Gu and Ryan A. Rossi and Changyou Chen and Tong Sun},
  journal= {arXiv preprint arXiv:2411.01106},
  year   = {2025}
}

备注

Accepted to ICLR 2025