中文

超越文本:面向工业应用的多模态输入RAG优化

计算与语言 2024-10-30 v1 人工智能

摘要

大型语言模型(LLMs)在回答问题方面展现出令人印象深刻的能力,但它们缺乏领域特定知识且容易产生幻觉。检索增强生成(RAG)是应对这些挑战的一种方法,而多模态模型正逐渐成为处理文本和图像的有前景的AI助手。本文描述了一系列实验,旨在确定如何将多模态模型最佳地集成到工业领域的RAG系统中。实验的目的是确定在工业领域文档中,将图像与文本一起包含是否会提高RAG性能,并为此类多模态RAG系统找到最优配置。我们的实验包括两种图像处理和检索方法,以及两种用于答案合成的LLM(GPT4-Vision和LLaVA)。这些图像处理策略涉及使用多模态嵌入和从图像生成文本摘要。我们采用LLM-as-a-Judge方法评估实验。我们的结果表明,多模态RAG可以优于单模态RAG设置,尽管图像检索比文本检索构成更大的挑战。此外,与使用多模态嵌入相比,利用图像的文本摘要是一种更有前景的方法,为未来的进步提供了更多机会。

关键词

引用

@article{arxiv.2410.21943,
  title  = {Beyond Text: Optimizing RAG with Multimodal Inputs for Industrial Applications},
  author = {Monica Riedler and Stefan Langer},
  journal= {arXiv preprint arXiv:2410.21943},
  year   = {2024}
}