中文

Visual RAG:无需微调扩展MLLM视觉知识

计算机视觉与模式识别 2025-01-22 v1 人工智能 机器学习

摘要

多模态大语言模型(MLLM)在需要跨视觉和文本模态推理的计算机视觉任务中取得了显著的性能,但其能力受限于预训练数据,更新知识需要大量微调。近期研究探索了使用In-Context Learning(ICL)通过提供 demonstrating examples 作为上下文来增强MLLM在多个任务中的性能,显示许量ICL相对于少量ICL具有显著的改进。然而,依赖大量 demonstrating examples以及MLLM有限的上下文窗口构成了重要障碁。本文旨在通过引入一种新方法——Visual RAG——来解决这些挑战,该方法协同结合了MLLM从上下文中学习的能力与检索机制。该方法的核心在于通过选择最相关的demonstrating examples来增强MLLM的知识,使其能够通过类比学习。在这种方式下,依赖于推理时提供的动态新信息,结果系统不受限于从训练数据中提取的知识,却能在不进行微调的情况下快速轻松地更新。此外,这大大减少了提高模型图像分类性能的计算成本,并扩展了模型知识以适应其未训练的新视觉领域和任务。针对八个不同数据集上的八个不同任务进行了广泛实验,显示与最新SOTA方法(即许量ICL)相比,所提出的Visual RAG能够在大大减少demonstrating examples的数量(平均约仅为23%)的情况下,获得接近或更高的准确率(平均约+2%)。

关键词

引用

@article{arxiv.2501.10834,
  title  = {Visual RAG: Expanding MLLM visual knowledge without fine-tuning},
  author = {Mirco Bonomo and Simone Bianco},
  journal= {arXiv preprint arXiv:2501.10834},
  year   = {2025}
}