MLLMs 在视觉丰富文档检索中在 RAG 中的角色:综述
信息检索
2026-01-08 v1 计算与语言
摘要
视觉丰富文档 (VRD) 通过布局相关语义、脆弱的 OCR 以及复杂图形和结构化表格中跨越的证据,对检索增强生成 (RAG) 提出了挑战。本综述考察了多模态大语言模型 (MLLM) 如何被用于使 VRD 检索在 RAG 中实际可行。我们将文献组织为三个角色:模态统一描述器、多模态嵌入器和端到端表示器。我们沿检索粒度、信息保真度、延迟和索引大小,以及与重排序和 grounding 的兼容性进行比较。我们还概述了关键权衡,提供一些实用指导,关于何时优先选择各个角色。最后,我们确定了未来研究的有前景的方向,包括自适应检索单元、模型规模缩减以及评估方法的开发。
引用
@article{arxiv.2601.03262,
title = {Roles of MLLMs in Visually Rich Document Retrieval for RAG: A Survey},
author = {Xiantao Zhang},
journal= {arXiv preprint arXiv:2601.03262},
year = {2026}
}
备注
18 pages; accepted at AACL-IJCNLP 2025 (main conference)