中文

文本基准与图像基准在多模态检索增强生成大语言模型系统中的比较

计算与语言 2025-11-25 v2

摘要

近期在检索增强生成 (Retrieval-Augmented Generation, RAG) 方面的进展使大型语言模型 (Large Language Model, LLM) 能够访问包含文本和视觉信息(如金融文件中的图表、图示和表格)的多模态知识库。然而,现有多模态 RAG 系统依赖于 LLM 基于摘要将图像转换为文本进行预处理,仅将文本表示存储在向量数据库中,这会导致关键的下游检索和问答所需的上下文信息和视觉细节丢失。为此,我们提出一种全面的比较分析,评估两种检索方法:文本基准块检索(图像在嵌入前被总结为文本)和直接多模态嵌入检索(图像以原生形式存储在向量空间中)。我们在 6 个 LLM 模型和 2 个多模态嵌入模型上评估所有三种方法,基于一个新创建的金融报告会 benchmark(包含 40 个问答对,每个问答对配有 2 个文档:1 个图像和 1 个文本块)。实验结果表明,直接多模态嵌入检索显著优于 LLM 摘要基准方法,在平均精度 (mAP@5) 上提升 13 个百分点,在折扣累计收益 (nDCG@5) 上提升 11 个百分点。这些收益分别对应 mAP@5 和 nDCG@5 的相对提升幅度为 32% 和 20%,显著提升了实际应用效果。我们 additionally 发现,直接多模态检索产生的答案在准确性和事实一致性方面更优,LLM 评估的成对比较中表现更佳。我们表明,LLM 摘要在预处理阶段引入信息损失,而直接的多模态嵌入保留了视觉上下文,便于检索和推理。

关键词

引用

@article{arxiv.2511.16654,
  title  = {Comparison of Text-Based and Image-Based Retrieval in Multimodal Retrieval Augmented Generation Large Language Model Systems},
  author = {Elias Lumer and Alex Cardenas and Matt Melich and Myles Mason and Sara Dieter and Vamse Kumar Subbiah and Pradeep Honaganahalli Basavaraju and Roberto Hernandez},
  journal= {arXiv preprint arXiv:2511.16654},
  year   = {2025}
}